AI 应用上线后准确率不达标怎么办?谁来持续调优?
准确率不达标时先按知识、检索、模型、接口和样本口径归因;开发缺陷由服务商修复,业务内容由客户负责,模型平台变化由双方按合同处理。
“AI 从 80 分迭代到 90 分”不是可靠承诺,因为不同任务的准确率定义、风险和起点完全不同。合同签订前就应冻结一套代表性样本,注明什么算正确、部分正确、应拒答和严重错误,并分别约定试运行门槛与正式上线门槛。没有这一层,双方很容易在上线后争论是系统没做好,还是客户期望变了。
在确定模型、数据与上线边界时,还可以对照 企业如何用 AI OCR 自动识别订单和录入系统? 和 有哪些公司可以开发私有化部署的 AI 助手?;这些内容补充了需要放在同一项决策中考虑的上下文。
先归因,再确定谁修
| 不达标来源 | 典型证据 | 首要责任 | 处理方式 |
|---|---|---|---|
| 权威资料缺失、过期或冲突 | 正确答案在知识库中不存在 | 客户业务负责人 | 补齐并审核口径,服务商协助入库 |
| 解析、切分、检索或权限错误 | 正确资料存在但未进入允许的上下文 | 服务商 | 按缺陷等级修复并回归 |
| 模型未忠实使用正确证据 | 正确片段已提供,答案仍偏离 | 服务商主导,模型商提供底层能力 | 调整上下文、提示、模型或增加人工门槛 |
| 第三方模型升级或下线 | 同一版本外部能力发生变化 | 按供应链条款共同处置 | 锁版本、切换备选、重新回归或降级 |
| 业务接口返回错误 | 日志显示源系统字段或权限异常 | 接口所有方 | 修接口、数据或映射,不用提示词掩盖 |
| 新问题超出约定范围 | 评测集中没有该任务和资料 | 双方变更评估 | 补样本、确认费用和新门槛 |
开发服务商不应把所有问题推给“模型有概率”,客户也不能在验收后增加新行业、新语言或新动作仍要求原指标不变。合同至少写清评测集所有权、抽样方法、严重错误清单、模型与知识版本、缺陷保修期、运营服务包含的工时或迭代次数、第三方费用、响应时间和停止服务条件。
修复必须留下前后对照
每个失败病例保存问题、标准答案、知识版本、检索片段、提示词/模型版本、工具调用和实际输出。先判断正确证据能否找到,再固定证据测试生成,最后跑端到端;一次只改一个主要变量,避免换模型、改切分和改提示词同时发生后无法归因。修复完成后重跑完整冻结集,并把新病例加入回归集,不能只验证刚修的十条。
指标也要按任务拆开。知识问答测检索 recall@k、有证据正确率、引用一致率、正确拒答率和严重错答;文档抽取测字段准确率、漏项与人工复核分钟数;Agent 测任务完成率、工具参数正确率、重复/越权动作和回滚成功率。ISO/IEC 25059 提供了用于定义和评价 AI 系统质量的一致术语,见 ISO/IEC 25059:2023;它不是一个自动生成合格分数的认证表,项目仍需定义自身指标。
上线后监控的是退化,不只是平均分
知识更新、用户问题分布、模型版本和接口都会变化。应根据业务量、知识更新频率和错误后果设定抽样复核周期,监控高风险类别、无答案率、人工接管率、成本和延迟;严重错误一旦越过阈值,应自动关闭对应功能或切回人工。Google Research 的 ML Test Score强调生产机器学习需要数据、模型、基础设施测试和监控,这支持持续回归而非一次验收的做法。
滚水科技若承担持续调优,应在服务单中报告新增失败数、归因分布、已修项、回归结果、剩余风险和实际工时;“我们持续负责”不能没有服务期限与容量。客户则应指定能够裁定答案的业务负责人,并按时提供更新资料。若任一方无法履行前提,应缩小开放范围,而不是让机器人继续不受控回答。