Skip to main content
返回术语表
术语

翻译记忆(Translation Memory)

缩写: TM

存储已翻译片段以供重复使用的数据库,确保一致性并通过利用现有工作降低翻译成本。

5 分钟阅读
翻译技术生产力数据库本地化一致性

什么是翻译记忆?

**翻译记忆(TM,Translation Memory)**是计算机辅助翻译(CAT)工具中使用的数据库技术,它将源文本片段与其译文一起存储。当翻译人员处理新内容时,TM会自动识别以前翻译过的相同或相似文本,建议重复使用现有译文。

这项技术构成了现代翻译工作流程的基础,使组织能够随着时间的推移建立有价值的语言资产,从而提高效率、降低成本并确保一致性。

翻译记忆的工作原理

分段

TM工作流程的第一步是分段——将源内容划分为可翻译单元。通常,片段包括:

  • 句子(最常见)
  • 段落
  • 标题
  • 列表项
  • 表格单元格

CAT工具基于标点符号、格式和特定语言模式使用分段规则。

存储结构

每个TM条目(称为翻译单元或TU)包含:

  • 源片段:源语言的原始文本
  • 目标片段:目标语言的译文
  • 元数据:创建日期、翻译人员、项目、质量状态等
  • 上下文:周围文本、文档结构信息

匹配类型

分析新内容时,TM识别不同的匹配级别:

匹配类型描述典型折扣
100%匹配完全相同的片段70-90%
上下文匹配(101%)100% + 相同的周围片段80-95%
模糊匹配(75-99%)相似但不完全相同30-70%
无匹配(0%)未找到相似内容0%

翻译记忆的类型

基于文件的TM

以本地文件形式存储,通常为TMX格式。

优势:

  • 易于共享和备份
  • 不需要服务器基础设施
  • 可离线工作

限制:

  • 无法实时协作
  • 版本控制困难
  • 需要手动同步

基于服务器的TM

多用户访问的中央数据库。

优势:

  • 实时更新
  • 并发访问
  • 集中管理
  • 更好的安全控制

限制:

  • 需要服务器基础设施
  • 需要互联网连接
  • 更高的复杂性

云端TM

托管在云基础设施中。

优势:

  • 无需基础设施管理
  • 自动备份
  • 全球可访问
  • 可扩展性

限制:

  • 数据驻留问题
  • 持续订阅费用
  • 依赖提供商

TM利用率和投资回报率

计算TM利用率

TM利用率衡量与现有译文匹配的新内容百分比:

利用率 = (匹配词数 / 总词数) × 100

行业基准

内容类型典型利用率成本节省
软件更新60-80%50-70%
产品手册40-70%35-60%
法律合同30-50%25-40%
营销内容10-30%10-25%
技术文档50-70%40-60%

长期价值

TM价值随时间累积:

  • 第1年:建立资产(较低利用率)
  • 第2-3年:从以前的工作中获得显著利用率
  • 第4年及以后:高利用率,大幅节省成本

维护良好的TM可以为重复性内容类型降低40-60%的翻译成本。

翻译记忆最佳实践

TM维护

  1. 定期清理

    • 删除重复条目
    • 删除过时的译文
    • 修复不一致
  2. 质量控制

    • 导入外部TM前进行审核
    • 按质量级别标记条目
    • 实施审批工作流程
  3. 组织管理

    • 使用描述性TM名称
    • 按领域/客户维护单独的TM
    • 记录TM历史和来源

分段策略

  • 使用一致的分段规则
  • 避免过度分段(失去上下文)
  • 避免分段不足(减少匹配)
  • 考虑缩写处理

TM集成

  • 将TM与术语数据库连接
  • 实施语料库搜索
  • 为模糊匹配设置适当的惩罚级别
  • 配置自动传播设置

翻译记忆 vs 机器翻译

方面翻译记忆机器翻译
来源人工翻译AI生成
质量经验证、一致可变
学习来自过去的工作来自训练数据
最适合重复性内容新内容
成本模式资产建设按词/API

现代方法:许多组织结合两者:

  1. 首先检查TM中的现有译文
  2. 对无匹配片段使用MT
  3. 人工审核和后期编辑
  4. 将批准的译文反馈到TM

TMX:标准格式

**TMX(Translation Memory eXchange)**是在不同CAT工具之间交换翻译记忆的ISO标准格式。

TMX结构

<tmx version="1.4">
  <header srclang="en" adminlang="en" datatype="plaintext"/>
  <body>
    <tu>
      <tuv xml:lang="en">
        <seg>Hello, world!</seg>
      </tuv>
      <tuv xml:lang="zh">
        <seg>你好,世界!</seg>
      </tuv>
    </tu>
  </body>
</tmx>

TMX优势

  • 通用兼容性
  • 保留元数据
  • 支持多种语言
  • 行业标准

高级TM概念

上下文匹配

上下文匹配不仅考虑片段本身,还考虑周围内容:

  • 前一片段:之前的内容
  • 后一片段:之后的内容
  • 文档结构:标题、格式

这使得对于模糊片段能够获得更准确的匹配。

TM惩罚

CAT工具在某些情况下应用惩罚来降低匹配分数:

  • 不同的文档类型
  • 不同的客户/项目
  • 较旧的翻译日期
  • 多个TM来源

TM对齐

从现有译文创建TM:

  1. 导入源文档
  2. 导入译文文档
  3. CAT工具自动对齐句子
  4. 人工审核和更正
  5. 导入到TM

常见问题

翻译记忆应该有多大?

没有理想的大小——质量比数量更重要。维护良好的50,000翻译单元的TM可能比混乱的500,000单元的TM更有价值。关注相关性和准确性。

翻译记忆可以在不同的CAT工具之间共享吗?

可以,使用TMX(Translation Memory eXchange)格式。TMX是行业标准,可以在几乎所有CAT工具之间交换TM。

模糊匹配如何工作?

模糊匹配算法使用莱文斯坦距离、词元匹配和n-gram分析等技术比较片段。75%的模糊匹配意味着大约75%的内容相同,25%不同。

应该使用一个TM还是多个TM?

这取决于您的工作流程。常见方法:

  • 一个主TM + 项目TM
  • 按领域/客户分开的TM
  • 分层TM(已验证 vs. 未验证)

如何处理TM冲突?

当多个TM包含同一源文的不同译文时:

  • 按可靠性优先排序TM
  • 使用上下文匹配
  • 实施审批工作流程
  • 考虑基于机器学习的选择

TM和术语库有什么区别?

TM存储翻译的片段(句子),而术语库存储带有定义和批准译文的单个术语。两者在CAT工具中协同工作以实现最大一致性。

KTTC团队
翻译技术专家
5分钟阅读

We use cookies to improve your experience. Learn more in our Cookie Policy.