什么是翻译记忆?
**翻译记忆(TM,Translation Memory)**是计算机辅助翻译(CAT)工具中使用的数据库技术,它将源文本片段与其译文一起存储。当翻译人员处理新内容时,TM会自动识别以前翻译过的相同或相似文本,建议重复使用现有译文。
这项技术构成了现代翻译工作流程的基础,使组织能够随着时间的推移建立有价值的语言资产,从而提高效率、降低成本并确保一致性。
翻译记忆的工作原理
分段
TM工作流程的第一步是分段——将源内容划分为可翻译单元。通常,片段包括:
- 句子(最常见)
- 段落
- 标题
- 列表项
- 表格单元格
CAT工具基于标点符号、格式和特定语言模式使用分段规则。
存储结构
每个TM条目(称为翻译单元或TU)包含:
- 源片段:源语言的原始文本
- 目标片段:目标语言的译文
- 元数据:创建日期、翻译人员、项目、质量状态等
- 上下文:周围文本、文档结构信息
匹配类型
分析新内容时,TM识别不同的匹配级别:
| 匹配类型 | 描述 | 典型折扣 |
|---|---|---|
| 100%匹配 | 完全相同的片段 | 70-90% |
| 上下文匹配(101%) | 100% + 相同的周围片段 | 80-95% |
| 模糊匹配(75-99%) | 相似但不完全相同 | 30-70% |
| 无匹配(0%) | 未找到相似内容 | 0% |
翻译记忆的类型
基于文件的TM
以本地文件形式存储,通常为TMX格式。
优势:
- 易于共享和备份
- 不需要服务器基础设施
- 可离线工作
限制:
- 无法实时协作
- 版本控制困难
- 需要手动同步
基于服务器的TM
多用户访问的中央数据库。
优势:
- 实时更新
- 并发访问
- 集中管理
- 更好的安全控制
限制:
- 需要服务器基础设施
- 需要互联网连接
- 更高的复杂性
云端TM
托管在云基础设施中。
优势:
- 无需基础设施管理
- 自动备份
- 全球可访问
- 可扩展性
限制:
- 数据驻留问题
- 持续订阅费用
- 依赖提供商
TM利用率和投资回报率
计算TM利用率
TM利用率衡量与现有译文匹配的新内容百分比:
利用率 = (匹配词数 / 总词数) × 100
行业基准
| 内容类型 | 典型利用率 | 成本节省 |
|---|---|---|
| 软件更新 | 60-80% | 50-70% |
| 产品手册 | 40-70% | 35-60% |
| 法律合同 | 30-50% | 25-40% |
| 营销内容 | 10-30% | 10-25% |
| 技术文档 | 50-70% | 40-60% |
长期价值
TM价值随时间累积:
- 第1年:建立资产(较低利用率)
- 第2-3年:从以前的工作中获得显著利用率
- 第4年及以后:高利用率,大幅节省成本
维护良好的TM可以为重复性内容类型降低40-60%的翻译成本。
翻译记忆最佳实践
TM维护
定期清理
- 删除重复条目
- 删除过时的译文
- 修复不一致
质量控制
- 导入外部TM前进行审核
- 按质量级别标记条目
- 实施审批工作流程
组织管理
- 使用描述性TM名称
- 按领域/客户维护单独的TM
- 记录TM历史和来源
分段策略
- 使用一致的分段规则
- 避免过度分段(失去上下文)
- 避免分段不足(减少匹配)
- 考虑缩写处理
TM集成
- 将TM与术语数据库连接
- 实施语料库搜索
- 为模糊匹配设置适当的惩罚级别
- 配置自动传播设置
翻译记忆 vs 机器翻译
| 方面 | 翻译记忆 | 机器翻译 |
|---|---|---|
| 来源 | 人工翻译 | AI生成 |
| 质量 | 经验证、一致 | 可变 |
| 学习 | 来自过去的工作 | 来自训练数据 |
| 最适合 | 重复性内容 | 新内容 |
| 成本模式 | 资产建设 | 按词/API |
现代方法:许多组织结合两者:
- 首先检查TM中的现有译文
- 对无匹配片段使用MT
- 人工审核和后期编辑
- 将批准的译文反馈到TM
TMX:标准格式
**TMX(Translation Memory eXchange)**是在不同CAT工具之间交换翻译记忆的ISO标准格式。
TMX结构
<tmx version="1.4">
<header srclang="en" adminlang="en" datatype="plaintext"/>
<body>
<tu>
<tuv xml:lang="en">
<seg>Hello, world!</seg>
</tuv>
<tuv xml:lang="zh">
<seg>你好,世界!</seg>
</tuv>
</tu>
</body>
</tmx>
TMX优势
- 通用兼容性
- 保留元数据
- 支持多种语言
- 行业标准
高级TM概念
上下文匹配
上下文匹配不仅考虑片段本身,还考虑周围内容:
- 前一片段:之前的内容
- 后一片段:之后的内容
- 文档结构:标题、格式
这使得对于模糊片段能够获得更准确的匹配。
TM惩罚
CAT工具在某些情况下应用惩罚来降低匹配分数:
- 不同的文档类型
- 不同的客户/项目
- 较旧的翻译日期
- 多个TM来源
TM对齐
从现有译文创建TM:
- 导入源文档
- 导入译文文档
- CAT工具自动对齐句子
- 人工审核和更正
- 导入到TM
常见问题
翻译记忆应该有多大?
没有理想的大小——质量比数量更重要。维护良好的50,000翻译单元的TM可能比混乱的500,000单元的TM更有价值。关注相关性和准确性。
翻译记忆可以在不同的CAT工具之间共享吗?
可以,使用TMX(Translation Memory eXchange)格式。TMX是行业标准,可以在几乎所有CAT工具之间交换TM。
模糊匹配如何工作?
模糊匹配算法使用莱文斯坦距离、词元匹配和n-gram分析等技术比较片段。75%的模糊匹配意味着大约75%的内容相同,25%不同。
应该使用一个TM还是多个TM?
这取决于您的工作流程。常见方法:
- 一个主TM + 项目TM
- 按领域/客户分开的TM
- 分层TM(已验证 vs. 未验证)
如何处理TM冲突?
当多个TM包含同一源文的不同译文时:
- 按可靠性优先排序TM
- 使用上下文匹配
- 实施审批工作流程
- 考虑基于机器学习的选择
TM和术语库有什么区别?
TM存储翻译的片段(句子),而术语库存储带有定义和批准译文的单个术语。两者在CAT工具中协同工作以实现最大一致性。
