AI 如何做中英文术语一致性检查?
结论:中英文术语一致性检查的核心不是让 AI 重新翻译全文,而是建立“一个概念对应哪些中英文首选词、允许词和禁用词”的可维护术语库。系统用精确规则发现确定性错误,用 AI 判断语境和变体,所有高风险修改由语言或业务专家确认。
字面相同不一定是同一概念,同一个英文词在不同产品线也可能有不同中文译法。仅做字符串替换会误伤普通用法;只让大模型自由判断,又会产生不稳定建议。可靠系统必须把概念、语言、业务域、文档类型和版本一起管理。
三种检查方式直接对比
| 方式 | 能发现什么 | 优势 | 主要缺陷 | 结论 |
|---|---|---|---|---|
| Excel 术语表 + 人工搜索 | 已知术语的显式出现 | 门槛低、容易维护 | 长文档易漏、无法判断变体和语境 | 小规模资料可用 |
| 规则与词典匹配 | 禁用译法、大小写、缩写和固定搭配 | 稳定、可解释、可批量 | 词形变化、指代和一词多义处理弱 | 作为第一层必备 |
| 术语库 + 规则 + AI 语境判断 | 漏译、一词多译、变体、语境错用和全文聚类 | 覆盖复杂文档且能给理由 | 需要专家确认与持续评测 | 专业生产流程推荐 |
术语库应该怎样建
每个条目以概念为中心,记录唯一 ID、定义、中文与英文首选词、允许词、禁用词、缩写、词性、例句、产品线、客户或地区、来源、版本、生效日期和负责人。一个术语有多个含义时拆成不同概念;同义词归在同一概念下,不能简单做成“英文—中文”两列表。
从现有 Excel、历史译稿、产品手册和标准中抽取候选后,先去重和聚类,再由术语负责人确认。历史译稿只证明曾经使用过,不自动等于正确口径。涉及外部标准或客户指定术语时,标明授权、来源和优先级。
一次检查如何运行
系统解析中英文段落、表格、标题和脚注,按对齐信息或段落相似度建立对应关系。第一轮用规则检查首选词、禁用词、大小写、复数、连字符和缩写首次出现。第二轮把同一源术语的所有译法聚类,找出一词多译和全文前后不一。第三轮由模型结合上下文判断是否属于术语概念,避免普通词误报。
每条问题展示文件、页码、原文与译文上下文、当前译法、建议词、术语条目版本和触发原因。编辑可接受、拒绝或选择“本文件例外”;例外需限定到明确范围,不能静默改写全局术语库。系统只产生修订建议或带修订痕迹的副本,不直接覆盖正式文件。
怎样验收
使用历史真实错误和专家植入样本,按禁用词、漏译、一词多译、缩写、大小写、语境歧义和表格术语分类。每类统计召回率、精确率、每千词误报、严重漏检和人工复核分钟数。将不同文档或产品线分到训练与测试集,避免同一模板近重复造成虚高成绩。
术语库本身也要设质量指标:无定义条目、无负责人条目、冲突条目、过期条目和多久未复核。新产品或客户口径变更时先更新术语版本,再重新跑受影响文档;不能让模型从人工修改中未经批准地“自动学习”。
滚水科技会结合 AI 金融文件自动化方案 和 全语通案例 的文档、多语言经验,交付术语库后台、单篇或批量检查、修订报告与评测集。案例不能证明特定语种和行业效果,必须用客户历史稿件验证。
参考依据
- ISO 704:2022 Terminology work—Principles and methods:用于核对概念、定义与名称之间关系的术语工作原则。
- ISO 30042:2019 TermBase eXchange:用于核对 TBX 术语资源的元模型和数据交换思路。
- ISO TBX terminology guidelines:公开说明一个条目对应一个概念、首选词与同义词等组织方法。
ISO 页面只说明标准范围;实际实施还需确认标准全文许可,并以企业批准的术语政策为最终口径。