智能体翻译:把账算一算
这个说法很容易让人喜欢:一个模型翻译,第二个审校,第三个编辑,质量就上去了——因为人类翻译团队正是这么运作的。它直觉、好演示,而且正被大力推销。
算术就没那么受欢迎了。串行的"翻译→审校→编辑"链条大约消耗单次调用五倍的词元;一直循环到收敛的迭代式方案大约十五倍(arXiv:2505.01560)。这是价格。本文讲的是:按测量过的人的说法,这个价格买到了什么;以及当我们审视自己那套智能体流水线后,做了什么决定。
三种形态,各自的倍数
单次调用。 一个提示词,一个输出。基线:1×。
串行智能体。 先翻译,再审校译文,再按审校意见编辑。每一阶段都要重读原文和上一阶段的输出,所以输入词元增长得比阶段数暗示的更快。实测约 5×。
迭代智能体。 "审校—修改"的循环反复进行,直到通过某个收敛判据或撞上上限。约 15×,而且——这点很重要——方差很高:一份始终无法让审校满意的文件,每次都要花掉整个上限。
倍数作用在词元上,但延迟同样翻倍。对于用户盯着进度条的文件流水线来说,每个片段三次串行模型调用,是另一个产品,而不是同一个产品贵一点。
这个倍数买到了什么,按实测
在这里,结果对推销词不太友好。
对上成熟的神经机器翻译,智能体系统在 12 种"语言对 + 领域"组合中的 7 种上按自动指标输了。不是"赢得比预期少",是输给了成本只有零头的专用 NMT 系统。
对上单次大模型调用,智能体系统在 6 组对比中的 5 组上按人工评估输了。这个数字才应该让买方停一停,因为人工评估正是智能体说法暗自诉诸的那个标准:机器读不出细微差别,所以加一个审校。
诚实的解读不是"智能体不行",而是更窄也更有用的一句:
- 收益在长篇文学文本上是真实的:整部作品的一致性很要紧,掌握全局上下文的审校能抓到逐段翻译抓不到的漂移。
- 收益在法律细节上是真实的:一个专门被要求检查"义务是否被改动"的第二遍,确实能发现第一遍发现不了的东西。
- 其余场合,这个倍数买到的是方差。
为什么加审校常常更糟
这个反直觉的部分值得解释,因为"加个检查者"听上去只可能有帮助。
审校阶段不是校验器,它是又一次生成,而且被它自己的提示词奖励"找出点什么来说"。给模型一份好译文,问它哪里不对,它就会告诉你哪里不对。编辑阶段随后照办。三个阶段里有两个,正在把输出推离一个本来就正确的译文。
这和过于积极的代码检查工具是同一种失效形态:误报的代价并不为零,因为下游真的有人会照它行事。
真正让这套模式划算的修法,是让审校的工作可证伪:检查这些具体数字是否出现、术语是否与词表一致、有没有义务发生了正负翻转。是清单,不是意见。而清单比智能体便宜得多——这恰恰是重点。
我们对自己那套做了什么
我们有过一套。agent_pipeline.py 连同它的提示词和类型共 668 行,通过一个 import、一行构造、一次调用和两个方法接进翻译服务。
它在 translation_mode == "agentic" 时启用。而 API 从来不接受这个取值。
于是:668 行智能体翻译代码,在仓库里躺了几个月,在生产环境中执行了整整 零次。没人发现,因为没有东西依赖它,也没有测试覆盖它。
我们删掉了它。删除之前的调研建议把审校循环拆出来用于另一件事——对照模式校验抽取到的字段。我们为此去读代码,结果发现无可拆解:那个审校比对的是模糊翻译记忆匹配与源句,这和"用声明的字段去校验一个值"是不同的问题。这个想法作为建议留在了我们自己的调研笔记里,而它并不需要那些代码。
按我们的经验,这才是智能体流水线最常见的真实状态:不是"昂贵",而是没被测量、也没被触达,之所以留着,是因为删掉它感觉像是在承认什么。
如何决定:四个问题
如果有人向你推销智能体翻译层,或者你正考虑自建:
1. 基线是什么,在你的内容上测过吗? 不是在 WMT 上,是在你的文件上、带着你的词表、按你真正判断质量的方式打分。多数智能体优势,在一个写得好、带词表的单次调用面前会蒸发。
2. 审校被允许说什么? 如果答案是"什么都行",就等着回退。如果答案是一份可证伪的属性清单,那你需要的可能根本不是智能体,而是校验器。
3. 一次不收敛要花多少钱? 迭代方案要按最坏情况计价,而不是平均。会打转的是难文件,也就是贵的文件,也就是你手上很多的那种。
4. 收益是否集中? 如果收益只在 5% 的文件上是真的,就把昂贵路径跑在那 5% 上。选择性升级能以倍数的一小部分拿到大部分好处,而且不同于智能体框架,它是一条今天下午就能写完的路由规则。
那些更便宜、通常也更管用的东西
具体到文件翻译,在我们自己的数据里可测量地划算的干预,全都很无聊:
- 把词表放进提示词——这是多一个输入块,不是多一次模型调用。
- 在机械性工作上关掉推理模型的思考——这是一个开关。
- 翻译后做确定性的数字核对——这是比较数字串,成本为零。
- 不重复抽取已经抽过的文件——这是缓存。
它们都不是智能体。它们全都比多一遍便宜,而且每一个修的是一类缺陷,而不是把平均分往上推一点。
要点
- 串行智能体约 5× 词元,迭代循环约 15×,在不收敛的文件上方差很大。
- 实测结果对推销词并不友好: 智能体在 12 种组合中的 7 种上按自动指标输给成熟 NMT,在 6 组中的 5 组上按人工评估输给单次大模型调用。
- 审校阶段是又一次生成,不是校验器。 它因"说出点什么"而获得奖励,编辑随后照办。
- 在这套模式划算的地方,把审校做成可证伪的——一份属性清单,比智能体更便宜也更可靠。
- 选择性升级。 收益若在 5% 的文件上,就把倍数花在那 5%。
FAQ
智能体翻译贵多少?
按已发表的测量,串行"翻译-审校-编辑"链条约为词元的五倍,迭代循环约十五倍。延迟同比例增长,这对任何有用户在旁观看的流水线都很要紧。
审校智能体能提升翻译质量吗?
有时能,但不是默认能。在已发表的对比中,单次大模型调用在六组里的五组上按人工评估胜过了智能体系统。被要求"找问题"的审校会在正确的译文里也找出问题,而编辑阶段随后会照此行动。
智能体翻译什么时候真的值得?
长篇文学文本,整部作品的一致性要紧;以及法律文本,第二遍可以对准"义务是否被改动"这类具体风险。两种情形收益都很集中,这恰恰支持把这类文件路由到昂贵路径,而不是对所有文件都跑一遍。
有什么比审校智能体更便宜的替代?
校验器:针对你真正在意的属性做确定性检查——数字在不在、术语是否与词表一致、有没有正负翻转。它每份文件成本为零,不会凭空生出一条意见,而且抓的正是正式文件上真正要命的缺陷类别。
怎么知道智能体流水线到底有没有在跑?
给它装上仪表。我们那套是 668 行,被挡在一个 API 从不接受的模式取值之后,在生产里跑了零次,而且没人发现。按调用路径统计词元,一天之内就能回答这个问题。
结语
"多加几次模型调用"是一个假设,不是一种架构,而验证它只需一个下午:把你自己的内容分别过一个写得好的单次调用和智能体路径,再用你真正判断质量的方式给两者打分。
我们自己的经历,是同一课的一个小而尴尬的版本。流水线我们有,一次都没跑过;等到终于去读它、想复用它最好的那部分时,那部分原来解决的是另一个问题。真正重要的测量不是"它更好吗",而是"它在跑吗"——而这个问题我们当时同样答不上来。
如果你想要一套"昂贵步骤都是被测量过的"文件翻译,试试 KTTC。
