Skip to main content

正式文件翻译中,哪些东西必须原样活下来

叶莲娜·沃尔科娃2026/10/138 min read
认证翻译文件翻译质量清单正式文件行业

没有人为了享受而读一份翻译过来的出生证明。人们读它是为了核对——对着原件、对着数据库、对着一张必须填写的表格。这位读者不关心文字是否流畅,他关心证书编号对不对得上、姓氏的音译是不是和护照一致、有没有印章。

这是我们逐条使用的核查清单,每一条都附上漏掉它时真正会发生什么。它来自十六套文件模板的字段定义,以及我们在测量过程中抓到的丢失——不是来自某份标准文本。

一条规则,推出整张清单

如果有人或某个系统会拿它去和别的东西比对,它就必须原样活下来。

这一条判据能把所有东西分好类。建筑物的描述可以改写;不动产登记号不行,因为有人会把它贴进登记检索框。"由谁签发护照"这句话可以重组;签发机关代码不行,因为它是逐位核对的。

下面每一条,都是这条规则在某一类最常丢失的数值上的具体应用。

1. 登记代码与标识符

税号、企业注册号、不动产登记号、保险号、证书字号。它们是文件里代价最高的数值,也最容易丢——对任何以"可读文本"为目标的处理来说,它们看上去就是噪声。

我们实测到的三种具体失效:

一串数字里掉了几位。 在一份报关单上,我们跟踪了 28 个原文数字走完整个翻译流程。26 个原样出来。剩下两个里,一个是被有意改写的日期,另一个是真正的丢失——第二个企业注册代码,目标表单里没有对应的栏位。

代码被悄悄粘成一个。 发货人一行写着 (91330206MAD62XJF0Y)(33029600GQ),那是两个代码,不是一个长代码。如果抽取模式里只有一个字段,你会保住第一个、丢掉第二个,而输出看上去很完整。

代码不是你以为的那个代码。 个体工商户登记摘要带的是 15 位的 ОГРНИП,法人登记摘要带的是 13 位的 ОГРН。它们来自不同的登记系统,标识符长得相似。一个标着"注册号"的字段,本身就在邀请你搞混。

2. 姓名的音译

姓名不翻译,只音译——而唯一正确的音译,是这个人其他证件上已经印好的那一个,通常是国际护照。

这里的失效很微妙也很昂贵:译文内部一致,对外错误。每一页都写 "Timoshchenko",护照上是 "Timoschenko",签证申请被拒。翻译件内部没有任何地方看起来是错的,它只在与另一份文件并排时才显出错——而那恰恰是它会被看的地方。

实用规则:音译是输入,不是输出。 去要护照上的拼法,而不要自己推导。如果不得不推导,就在文件里注明依据的是哪个标准。

3. 字号、编号与空白表格本身

证书印在带编号的空白表格上。字号与编号——例如俄罗斯户籍证书上的 I-ВС № 695914——标识的是这张具体的纸。正是它们让这张纸成为"文件",而不是关于文件的陈述。

它有两种坏法。明显的那种是丢掉。微妙的那种是从别处抄来,听上去不可能,直到你亲眼见到:我们在自己的抽取提示词里找到四处,用一个"看起来合理的编号"去向模型解释证书编号长什么样——而模型返回的正是那个示例,而不是页面上的值。一个存在、格式漂亮且错误的字号,比缺失的更糟,因为没有任何东西会把它标出来。

如果你在提示词里用示例,就让它展示形状——I-АА № NNNNNN——绝不要给一个值。

4. 印章与戳记文字

印章不是装饰:它写明机关,还常常带着注册号或税号。在认证翻译里,通常用方括号呈现:[印章:……]

两条用代价换来的规则:

  • 印章要转写,不要概述。 "公章"不是一枚写明了某个具体登记处的印章的译文。
  • 印章属于文件,不属于模板。 我们把自己的十六套表单全部审了一遍,专找从描摹来源文件里残留下来的数值。十五套干净。一套不是——一份公证的出境同意书,在印章区打印出某位具名公证人和他的税号,出现在它出具的每一份同意书上,不管实际是谁办理的公证。可用的占位符就闲置在两段之下。

最后这一例,正是本文存在的理由:一个错误的数值,合理、一致,而且从输出侧完全看不出来。

5. 背面与页边的标注

登记戳、附加证明书标注、"补发"字样、带经办人签名的更正,以及那些没人当成文件一部分的铅笔痕迹。它们都是文件的一部分。

现实困难在于:背面丢在扫描环节,而不是翻译环节。如果流程接受一份双面文件的单面扫描,那么在任何人开始翻译之前,丢失就已经发生了。要求提供两面,并把页数与文件自己声称的篇幅对上。

6. 电子签名证书及其有效期

电子出具的摘要带有签名区块:认证机构、证书序列号、有效期。在俄罗斯不动产登记摘要上,它们是很长的十六进制字符串加日期。

它们枯燥、冗长,而且正是接收机关用来判断电子文件是否真实的那部分。按规则 1 对待它们:原样、两个都要、带日期。中间掉了四个字符的证书序列号,不叫"基本正确"。

7. 什么不译——以及什么必须译

有些东西是有意保留原文的,有些则绝不能保留。这个区分不是文体偏好:它决定读者能否凭这份文件办事。

数值处理方式
姓名音译,与护照一致
登记代码、字号、证书编号原样
机关名称翻译,在需要标识具体机构时括注原文
文件类型名称翻译
身份与保险证件的标签翻译——我们正是在这里找到了真实的缺口

最后一行是我们发布过又修好的缺陷。我们那份不动产登记摘要的英文输出里,在整体为英文的文本中间,夹着西里尔字母写的"СНИЛС"和"Паспорт"。这不是误译,而是漏译,更难发现,因为周围的文字读起来毫无问题。

检查的通用形式:在完成的译文中搜索源语言文字的字符。 找到的每一处,要么是你能站得住脚的有意决定,要么是漏掉的数值。两种结果都有用;关键是哪一种都不该是意外。

8. 文件必须仍然是那份文件

最后,是包含以上全部的结构性一条:译文的版式必须允许与原件逐栏比对。一份数值全对但顺序错乱的清单,不是可用的认证翻译,因为核验的人不是在阅读,而是在配对。

对扫描件,这意味着填写一张为该文件类型制作的表单;对本身有真实结构的文件,这意味着就地替换文字、不动结构。

要点

  • "必须原样保留"的判据,是会不会有人拿它去比对。 代码、字号和证书编号会;描述性句子不会。
  • 音译是输入。 从护照取拼法而不是自己推导,否则你会得到内部一致、对外被拒。
  • 错误但合理的值,比缺失更糟。 提示词里的示例值、以及保留了来源文件数值的模板,产生的正是这种东西。
  • 印章文字、背面标注和签名证书是内容,不是装饰,而最后一项正是接收机关判断真伪的依据。
  • 检查成品译文里残留的源语言字符。 每一处命中要么是可辩护的决定,要么是缺口,你需要知道是哪一种。

FAQ

认证文件翻译中通常丢失的是什么?

按我们自己的测量,丢失集中在三处:目标表单没有字段可放的数值;重复标识符的第二个实例(模式只声明了一个字段,而文件里有两个企业代码);以及夹在已翻译文本中未被翻译的标签。纯粹的散文误译反而很少是问题。

姓名应该翻译还是音译?

音译,而且要与此人国际护照上已有的拼法一致。一份按标准音译正确、却与护照不同的译文仍会被拒,因为两份文件必须彼此对得上。

印章上的文字需要翻译吗?

需要,而且要转写而非概述——印章写明签发机关,往往还带注册号。通行做法是用方括号标注为印章,并原样保留其中的编号。

怎么核查数字是否在翻译中幸存?

比较原文与译文中最长的连续数字串,而不是词元:紧挨数字的标点会让词元比较报出虚假的丢失。日期单独处理,因为它们本来就会被合理改写。产出的是一个可以据以行动的计数,而不是一个相似度分数。

文件背面呢?

它是文件的一部分,而且通常丢在扫描而非翻译环节。要求提供两面,并把页数与文件对自身篇幅的任何声明交叉核对。

结语

这张清单里没有什么稀奇东西。每一条都是有经验的正式文件译者本来就会盯住的。自动化之后改变的是:失效变得安静而整齐——丢字段的模板每次都丢,而一条用合理证书编号教模型的提示词,是一次教会了所有文件。

所以清单不能再只是习惯,它必须变成测量:数字完整性比对、源语言字符扫描、以及对表单自身正在打印什么的审查。

如果你要翻译证书、报关单或登记摘要,并希望看到对着模式核验的字段级抽取,而不是凭感觉——试试 KTTC

We use cookies to improve your experience. Learn more in our Cookie Policy.