市面上很多 AI 产品就是"套个壳",你们做的 AI 应用和套壳有什么本质区别?
“套壳”不是看代码厚不厚、有没有 RAG,而是看产品是否只转发模型回答,却没有明确任务、可靠数据、业务控制、评测记录和持续运营责任。
给大模型加一个界面并不天然低劣:如果用户只需要通用写作或翻译,一个简洁界面可能就是合理产品。真正的问题是把通用模型能力包装成“懂企业、能准确办事”,却拿不出知识来源、权限控制、失败处理和实测结果。反过来,有向量库、工作流或私有化部署也不自动代表产品成熟;技术组件多,不等于业务结果好。
在确定模型、数据与上线边界时,还可以对照 工作流型 AI 智能体是什么?和普通聊天机器人有什么区别? 和 我们公司数据量不大、也不是科技公司,做 AI 有意义吗?;这些内容补充了需要放在同一项决策中考虑的上下文。
不看宣传词,直接检查交付层级
| 层级 | 实际能力 | 可以承诺什么 | 主要缺口 | 适合场景 |
|---|---|---|---|---|
| 模型转发界面 | 发送提示词并展示回答 | 通用生成体验 | 无企业事实来源、无任务保障 | 低风险写作与创意 |
| 场景化助手 | 固定模板、输入校验、结果编辑 | 缩短某类内容处理时间 | 仍不能代表企业事实 | 营销草稿、摘要、翻译 |
| 知识型应用 | 检索授权资料、标注出处、管理版本 | 在已收录资料范围内回答 | 检索错误和资料过期仍会传导 | 制度、产品、售后问答 |
| 业务型应用 | 身份权限、系统接口、审批、日志和回滚 | 在明确权限内查询或执行 | 集成与持续运营成本最高 | 查单、工单、预约等闭环 |
RAG 只是让模型在生成时使用外部检索结果。最早系统化提出这一方法的 NeurIPS 2020 RAG 论文讨论了外部非参数记忆、知识更新和来源问题,但论文结果不证明任意企业知识库都会准确。文档切错、权限过滤错误或检索不到正确段落时,接了 RAG 仍会答错;因此“支持 RAG”只能说明架构选择,不能作为产品效果证据。
能否上线要看五份证据
第一份是任务清单:明确用户是谁、输入是什么、允许输出什么以及不做什么。第二份是数据清单:每个知识源或接口的所有者、版本、权限和更新时间。第三份是冻结评测集:从真实任务抽样,保留标准答案与严重错误定义。第四份是运行记录:模型、提示词、检索结果、工具调用、人工修改和成本可追溯。第五份是运营责任:谁更新知识、处理失败、复盘投诉和决定回退。
以企业问答为例,至少分别统计“正确资料是否进入前 k 条”的检索召回率、有证据回答正确率、引用与答案一致率、该拒答时的拒答率、严重错答率、P95 响应时间和单次完整成本。以执行型 Agent 为例,还要记录工具参数正确率、重复执行、越权尝试、人工审批率和回滚成功率。只展示十个挑选过的成功对话,不足以证明可商用。
Google Research 的 ML Test Score指出,生产级机器学习系统需要覆盖数据、模型、基础设施测试与监控;这比“用了哪个模型”更接近产品成熟度。软件整体还可参照 ISO/IEC 25010:2023 产品质量模型审视可靠性、安全性、可维护性等质量特征,而不是只测回答效果。
滚水科技主动交付同一把尺子的证据
滚水科技可以提供知识接入、业务系统集成、权限和评测等开发服务,但不能仅凭这些能力描述就宣称项目一定优于现成产品。我们会在方案、合同或验收附件中交付需求边界、数据流图、评测设计及结果、接口与权限表、部署资产、监控告警和退出方案,并说明哪些结论仍待客户样本验证。客户只需确认业务代表性与结果是否可接受;若滚水科技拿不出这些证据,同样不能因为是“定制”就免于被判断为概念包装。
因此,本质区别不是“套壳 versus 自研模型”,而是“能否对一个明确业务结果提供可复跑证据并承担持续责任”。