Skip to main content

文件翻译的翻译记忆库:只收人工审校过的条目

叶莲娜·沃尔科娃2026/11/248 min read
翻译记忆库记忆库质量本地化策略文件翻译策略

翻译记忆库本应随着积累越来越好。而由机器写入的记忆库往往越来越糟,并且是无声无息地变糟:一条错误条目进去了,从此它就以一个自信的匹配身份回来——有时甚至是精确匹配,而精确匹配没有哪个评审会想到去质疑。

我们在一份报关单上撞上这件事之后改了政策,事情既具体又有教益。本文讲我们最终定下的规则——没有经过人工审校的内容不进入记忆库——它在第一天要付什么代价,以及为什么到第三个月反而更便宜。

机器写入的记忆库会对自己做什么

机制是一个没有阻尼的反馈回路。

机器翻译产出一个片段。流水线自动把它存进记忆库,因为存储便宜、而这个片段也许还能复用。之后一个相似片段到来,与已存条目在某个模糊阈值上匹配,于是那条已存译文被套用——如果匹配度足够高,还可能是静默套用。

每一步都合理。结果是:犯过一次的错误变成系统性犯的错误,而看到"来自记忆库的 95% 匹配"的评审,正被工具告知:这条曾经有人批准过。

在文件上,这种失效比在营销文案上更糟,原因只有一个:文件会重复。 同一发货人的十六份报关单共享大部分套语。学会了一种错误措辞的记忆库,会把它套到全部十六份上。

那次为我们买下这条规则的事故

我们遇到的是一份中国报关单,片段是商品规格——这类表单使用的竖线分隔字符串:

原文:  0|0|家用|按摩|无品牌|无型号|无编号
匹配到:0|0|家用|电热|...

对一条自动保存、无人审校的记忆库条目的 0.83 模糊匹配。两串在七个字段中只差一个:按摩与电热。周围的一切——那些零、"家用"、"无品牌/无型号/无编号"——完全相同,正因如此模糊得分才那么高。

被套用的译文说这批货是电加热的。它们是按摩器具。

这个故事值得讲,恰恰因为抽取是正确的。模型把页面读得毫无差错,翻译环节也没有误解任何东西。错误的词来自记忆库,而记忆库是被一次没人检查过的更早的机器翻译填进去的——传到我们这里的抱怨是"它换错了词",听上去像抽取缺陷,其实不是。

规则,及其三个组成部分

1. 未经人工审校的内容不进入记忆库。 两条自动保存路径都被关闭。记忆库只从"人工审校后提升"的路径、以及对成品文件的显式批准中获得内容。

2. 自动套用从 0.95 起。 低于它、直到 0.70,匹配会被套用但标记待审,而不是静默接受。低于 0.70 则走新的机器翻译:文件片段上的弱匹配是一项负债,而不是一次节省。

3. 查询侧也要按"已审校"标志过滤。 这一环最容易被忘。关闭写入路径没有用,如果读取路径仍会返回政策变更之前写入的行——所以精确匹配查询要求该标志,而历史行被直接清除了。

关于那次清除,值得诚实地说:一次单向迁移,删掉了所有未审校的行。第二次迁移又清掉了约三十四条,它们是通过我们第一遍漏掉的一条保存路径漏进来的。这件事没有巧妙版本。如果你决定记忆库只装审校过的内容,现存的未审校内容就必须离开。

代价是什么

这个取舍是真实的,值得直说,因为供应商不会说:

第一天:记忆库是空的。 每个片段都是新的机器翻译。单份文件成本更高、延迟更大,重复带来的杠杆为零。

它填充得很慢。 只有审校过的内容能进入,所以记忆库的增长速度取决于人工审校,而不是机器翻译。

有些节省永远不会到来。 没人审校的内容永远进不了记忆库,无论它重复多少次。

与之相对的,是一项好处:每一个匹配背后都站着一个人。 看着记忆库建议的评审,看到的是某个人批准过的东西——这正是"来自记忆库"这个标签一直暗示、而在机器写入的库里悄悄并不成立的含义。

对有法律后果的文件,我们认为这个取舍显而易见。对错误代价低廉的大批量内容,可能并非如此。

事后数字说了什么

有两项测量决定了我们如何运行它。

跨公司复用是真实的:39.8%。 我们本以为文件记忆库主要是按客户各自为政的——一个发货人的报关单只会帮到他自己。实际上近五分之二的复用跨越了公司边界,这就解决了"要不要按客户隔离记忆库"的设计问题。我们没有隔离。

被复用的部分并不是你猜的那些。 记录型的段落——结构化的重复行——比套语散文被复用得更多。这与"价值在于表头和标准条款"的直觉相反,也支持把结构化片段留在记忆库里,而不是当作噪声过滤掉。

导入既有的记忆库

如果你已经有一个记忆库——来自上一个工具,或客户给的 TMX——这条政策就有一个显而易见的张力:那个库不是审校的。

我们的答案是:导入的内容以未审校状态落库。片段被保存、可被检索,但不参与匹配;人工把自己信得过的那些,通过与其他内容相同的批准路径提升上来。

与其说这是折衷,不如说是政策的一致应用。来源不明的 TMX,正是这条规则要挡在匹配之外的未经核验的内容,而"曾经有人审校过"是文件本身无法证实的说法。导入、审校、批准——按这个顺序。

如何迁移一条既有流水线

四步,且必须按此顺序,否则会留下缝隙:

  1. 关闭写入路径。 全部。去找每一处会写入记忆库的地方,而不只是那个显而易见的——我们在第一次清理之后才找到第二条,而它已经漏进过数据。
  2. 在读取路径上按已审校标志过滤,让历史条目在你决定如何处置它们之前先停止被套用。
  3. 清除或隔离未审校的行。清除更简单;隔离让你之后还能审校其中有价值的部分。
  4. 提高自动套用阈值,并在其下增加一个待审层级。这一步限制的是未来任何漏网之鱼造成的损害。

真正止血的是第 1、2 步合在一起。第 3 步是清理,第 4 步是保险。

要点

  • 机器写入的记忆库会退化,而且是无声的:一条错误条目会永远以自信匹配的身份回来,标签的措辞还暗示着人工批准。
  • 文件让情况更糟,因为它们重复。 一种错误措辞会扩散到来自同一来源的每一份相似表单。
  • 我们的事故是七个字段里差一个的 0.83 匹配——报关单上"按摩"变成了"电加热",来自一个无人检查过的记忆库,而抽取环节完全正确。
  • 只关闭写入路径不够;查询也必须按已审校标志过滤,历史未审校行也必须清除。
  • 代价真实且前置: 空库、更多新机器翻译、增长缓慢。好处是每个匹配背后都站着一个人。

FAQ

为什么不让机器填充翻译记忆库?

因为存下一次的错误,此后会被系统性地套用,而记忆库这个标签暗示着有人批准过。在文件上效果会累积:相似表单不断重复,一种错误措辞会扩散到每一份与之模糊匹配的文件。

模糊匹配到多少才可以自动套用?

我们用 0.95 作为静默套用线,0.70–0.95 为"套用但标记",再低则走新的机器翻译。我们那次事故是 0.83 的匹配:在旧的 0.85 阈值下它被无审校地套用了,按现行政策它会被标记。

只收审校内容的记忆库,一开始不是没用吗?

是的,这就是代价。记忆库从空开始,大多数片段走新的机器翻译,它填充的速度取决于人工审校。在错误昂贵的文件上我们接受这一点;在错误廉价的大批量内容上,取舍可能相反。

导入的 TMX 怎么处理?

以未审校状态存下。片段可检索,但在人工按常规路径批准之前不参与匹配。来源不明的文件,正是这条政策要挡在外面的未经核验的内容。

翻译记忆库值得按客户隔离吗?

我们测得 39.8% 的复用跨越了公司边界,这构成了反对隔离的理由。另外值得知道的是:记录型的结构化段落比套语散文复用得更多,所以不要把它们当噪声过滤掉。

结语

支持"只收审校内容"的论据,并不是说机器翻译不好。而是说:翻译记忆库是一种主张——每一个匹配都在告诉评审,这个措辞此前被使用并被接受过。由机器写入的记忆库,会在没有任何人核对过的情况下作出这个主张。

代价在第一天付清,好处则悄无声息地累积——这种形状在公司内部很难推销。让我们容易接受它的,是那次具体的事故:一份文件写着"按摩"、而译文说"电加热"的报关单,出自一条每一个单独组件都在正确工作的流水线。

如果你想要一套记忆库中只存放经人批准内容的文件翻译,试试 KTTC

We use cookies to improve your experience. Learn more in our Cookie Policy.