Skip to main content

只对需要的片段做译后编辑,而不是整份文件

玛丽亚·索科洛娃2026/11/108 min read
译后编辑mtpe质量评估成本优化对比

改进机器翻译最显而易见的办法,是把它再交给模型跑一遍,请它给个更好的版本。这只是一行代码,感觉像是白得的质量。

它不是白得的,而近期的测量还表明,它往往也算不上质量:对整份文件做一次覆盖式的大模型二次处理,花掉的远多于换回来的(arXiv:2601.19410)。这个想法合理的版本是有选择的——只编辑质量评估判定为弱的片段。本文讲怎么定这个阈值、该测量什么,以及有选择的做法在实践中会以哪两种方式失败。

为什么覆盖式的二次处理令人失望

三个原因,第三个通常出人意料。

大多数片段并不需要它。 在一份典型文件里,大部分机器翻译片段是没问题的。对它们再跑一遍,是没有任何上行空间的花费。

这一遍并非无风险。 被要求"改进"一份正确译文的模型会改动它——因为它被要求这么做。有些改动是中性的,有些更糟;而在正式文件上,"变得不一样"本身就是代价:已经批准过某个措辞的评审,现在看到了一个新的。

它掩盖了问题所在。 覆盖式重写之后,你无法分辨哪些片段原本是弱的,因为它们全都变了。你毁掉的,正是本可以用来改进上游环节——提示词、词表、模型选择——的那个信号。

有选择的译后编辑规避了这三点,并产出一份价值不亚于编辑本身的副产品:一张"你的流水线在哪里吃力"的清单。

定向流水线的形态

四个阶段,只有第三个真正花钱:

  1. 翻译。 用你原本的路径。
  2. 逐片段评估质量。 先用便宜的启发式规则,只对被规则标记出来的片段动用大模型判断。(双层方案我们另文写过;这里适用同一套结构。)
  3. 对低于阈值的片段做译后编辑。 带上原文、当前译文,以及——这一点很关键——评估器给出的具体意见
  4. 只对被编辑过的片段重新评估,这样你才能知道这次编辑是否有帮助。

设计决策就在第三阶段。把片段被标记的原因交给编辑环节,正是"定向译后编辑"与"昂贵的改写服务"之间的分界。"这是机器翻译,改好它"得到的是重写;"这个概念的词表术语是 X,而译文用了 Y"得到的是修复。

如何设定阈值

阈值不是质量问题,而是代价不对称问题。在选定之前,先写下两个数:

  • 一次误标的代价。 一次不必要的编辑调用,外加把一个正确片段改坏的风险。
  • 一次漏标的代价。 一个缺陷被交付出去。在报关单或证书上,那意味着接收方退件。

对正式文件,第二个代价以很大幅度占据主导——这支持采用宽松的阈值:多标记、多编辑、接受浪费。对大批量营销内容,天平则倒向另一边。

接着测量大多数团队从不看的那个量:升级率。有多大比例的片段越过了阈值?

如果答案是 0%,你的第二层就是装饰,你在为一个什么都不改变的评估器付钱。如果答案接近 100%,你只是多绕了几步,把覆盖式二次处理重新发明了一遍。

我们踩中的是第一种。我们的规则式前置过滤器给一批真实的机器翻译片段打了 75 到 85 分,一个都没有升级。而当我们强制大模型层去看时,它给那十四个片段中的十三个打了 100 分。这个前置过滤器是保守而非错误——它低估好译文,也不放过坏译文——但实际效果是:一个从不运行的昂贵层,以及在正确译文上看到悲观数字的用户。

要盯住的正是这种失效:一个同时安全惰性的阈值。

该测量什么,按顺序

1. 升级率。 按文件类型分开看,而不是笼统一个数。报关单和证书的表现并不相同。

2. 编辑采纳率。 在你做过译后编辑的片段里,有多少真的被改好了?只对被编辑片段重新评估,几乎免费就能得到这个数。如果它很低,问题出在编辑提示词,而不是阈值。

3. 在被标记集合上的人工一致性。 抽一批被标记片段交给评审。如果他对大多数标记都不认同,那是评估器失准,再好的阈值也救不了。

4. 标记聚集在什么上。 这就是那份副产品,而长期看它是最有价值的产出。如果 60% 的标记都是词表不一致,解决办法不是加大译后编辑力度,而是把词表放进第一个提示词里。

有选择的做法会怎样失败

没有原因的编辑环节。 如果第三阶段收到的只是"这个片段分数低",它会重写而不是修复。把评估器的具体意见传下去。这也正是为什么一个可审查的评估器——输出错误类别与片段位置,而不是一个孤零零的数字——比一个相关性略高的更值钱。

会漂移的阈值。 换掉模型、提示词或词表,分数分布就会在你脚下移动。按上个季度的分布设定的阈值,可能悄无声息地变成惰性的,而这看上去恰恰像是"质量提升了"。任何上游组件变更之后都要重新核对升级率,并在它归零时告警。

什么时候译后编辑根本不是对的工具

对正式文件,有些缺陷根本不该走到译后编辑那里:

  • 缺失的数字。 用确定性方法比对数字串。比较不花钱,也没有意见。
  • 未翻译的标签。 在译文里扫描源语言文字的字符。同样免费。
  • 词表不一致。 直接核对术语,而不是去问模型"术语用得对不对"。

以上每一项,作为确定性检查都比作为一次大模型调用更便宜、更可靠、也更可解释。把译后编辑留给真正需要判断的东西:别扭的措辞、语域,以及第一遍处理得不好的歧义。

一般原则:不要把一次模型调用花在一次比较就能回答的问题上。

要点

  • 覆盖式的二次处理花得远比换回来的多,有改坏正确片段的风险,还毁掉了"流水线弱在哪里"的信号。
  • 给编辑环节原因,而不只是分数。 没有具体意见,第三阶段会重写而不是修复。
  • 从代价不对称出发定阈值,而不是从一个质量目标出发:正式文件上,漏掉的缺陷压倒浪费掉的调用。
  • 按文件类型测量升级率。 零意味着昂贵层是装饰;接近 100% 意味着你重建了覆盖式处理。
  • 确定性检查优先。 数字、未翻译标签和词表术语属于比较而非判断,不该消耗模型调用。

FAQ

什么是定向译后编辑?

只对质量评估器标记为弱的片段跑自动译后编辑,而不是覆盖整份文件。它以一小部分成本拿到大部分收益,并顺带产出一份"流水线在哪里吃力"的清单。

质量阈值该怎么选?

从误标(一次浪费的编辑,外加改坏正确片段的风险)与漏标(一个缺陷被交付)之间的不对称出发。对正式文件,第二个代价占主导,因此宽松的阈值是对的。然后通过测量实际升级比例来验证。

升级率应该是多少?

没有普适数字,但 0% 和接近 100% 都不对。零意味着评估器什么都没改变、昂贵层沦为装饰;接近 100% 意味着你多绕了几步重建了覆盖式处理。按文件类型分别测量。

译后编辑能修好缺失的数字吗?

能,但不该由它来做。数字完整性是原文与译文之间数字串的确定性比对——不花钱、不会凭空生成,而且抓的正是报关单和证书上最要命的那类缺陷。译后编辑是留给需要判断的问题的。

如果评估器和评审意见相左怎么办?

那说明评估器失准,任何阈值都修不好。抽取被标记的片段交给评审,先测量一致性,再去调别的:建立在坏信号之上的阈值,只是换了一个噪声子集而已。

结语

有选择的译后编辑是比覆盖式处理更便宜的架构,但这不是它的主要优势。主要优势在于:它迫使你拥有一个你信得过的质量评估——而一旦有了,它标记出来的清单会告诉你上游该修什么。

从中收获最多的团队,是把这些标记当作对自身流水线的缺陷报告,而不是当作一条待办队列。编辑一处词表不一致,修的是一个片段;把词表放进提示词,修的是全部。

如果你想要一套由质量评估决定"什么值得再看一眼"的文件翻译,试试 KTTC

We use cookies to improve your experience. Learn more in our Cookie Policy.