客户订单是 XML、还有 Excel / PDF / 图片等不同格式,系统能不能统一接入?
结论:可以统一接入,但入口不能共用一套解析规则。XML/Excel 按结构和模板映射,文本 PDF 做版面解析,扫描 PDF/图片做 OCR;所有结果先进入统一订单草稿,通过客户、商品、金额和重复校验后才能转为正式订单。
“统一”指后续业务使用同一个订单模型、状态和审核流程,不是强迫不同文件走同一种识别技术。结构化 XML 已经包含字段关系,再转成图片 OCR 会损失信息;Excel 需要处理工作表、单元格类型和合并区域;PDF 可能是带文字层的电子文件,也可能只是扫描图;手机照片还会有倾斜、反光和缺页。滚水科技会为每种来源建立适配器,原文件始终保留以便追溯。
在继续拆分功能、数据与验收场景时,还可以对照 散户和普通餐厅现在靠人工录单,能否减少人工二次录入?;这些内容补充了需要放在同一项决策中考虑的上下文。
各格式的合理路径如下:
| 来源格式 | 首选解析方式 | 可自动校验 | 主要异常 | 直接建议 |
|---|---|---|---|---|
| XML/EDI/API | 按 XSD 或接口版本验证后映射 | 节点、类型、枚举、必填与版本 | 命名空间、版本升级、编码和重复消息 | 稳定客户优先使用 |
| Excel/CSV | 模板、表头别名和类型映射 | 列、日期、数字、明细合计 | 合并单元格、公式缓存、多工作表和人为改列 | 提供下载模板和导入预检 |
| 文本型 PDF | 提取文字、坐标和表格结构 | 关键字、页码、金额勾稽 | 字体编码、跨页表格和阅读顺序 | 先判断有无可靠文字层 |
| 扫描 PDF/图片 | 图像预处理、OCR、版面/字段抽取 | 置信、格式、合计和主数据匹配 | 模糊、遮挡、手写、倾斜和缺页 | 低置信强制人工复核 |
XML 接口应保留来源客户、格式版本、消息 ID 和文件校验值。能获得对方 XSD 时,先按 W3C XML Schema 规范 检查结构,再做业务校验;XSD 通过只说明文档结构合法,不代表客户编号存在、价格有效或金额正确。未知扩展字段要按版本策略处理,不能静默丢弃后仍标记成功。
Excel 导入先展示预检结果,让操作人确认识别到的表头、记录数和错误行;日期、长编号、前导零和科学计数法要特别测试。标准 Office 文件可参考 Microsoft SpreadsheetML/Open XML 文档 解析单元格结构,但业务模板仍由双方定义。公式单元格应明确读取公式还是计算后的缓存值,不能因客户端未重算而导入旧金额。
PDF 和图片不得预先承诺统一“95% 以上”。准确率取决于版式、扫描质量、语言、印章、手写和字段定义,而且“字符识别正确”不等于“订单字段完整正确”。可用 PaddleOCR 官方项目 等工具跑基线,在客户样本上逐字段统计订单号、商品编码、数量、单价、金额、地址的完全正确率,并记录一份订单需要人工修改的时间。
统一订单模型建议包含来源、外部订单号、客户、收货主体、币种、税率、商品明细、数量、单价、总额、交期、附件和解析版本。进入正式订单前依次做文件级防重、客户和商品主数据匹配、金额勾稽、币种单位、权限与业务规则校验。无法匹配的商品不能由模型凭语义自动创建正式主数据,应进入人工选择或新增审批。
待复核池需要展示原文与字段并排对照,突出低置信和规则冲突;人工修改保存旧值、理由和操作者。人工结果能否用于优化模型,要看数据授权和质量审核,不是修改一次就自动“越用越准”。模板和规则按客户及生效时间版本化,历史文件重跑时记录新任务,不覆盖当初导入证据。
首期样本不应只规定“30 份以上”,而应按来源和长尾覆盖。选每种主要格式的常见模板、旧版本、缺字段、多页、退款/负数、外币、模糊扫描和手写样本,划分开发集与冻结验收集。验收报告给出逐格式数量、关键字段准确率、整单无需修改率、误接收率、重复拦截率、平均复核时间和正式入库错误数。
滚水科技的 AI 订单 OCR 方案 可承担图像类入口,但整个项目还包括主数据、规则、复核和订单流程。