什么是模糊匹配?
**模糊匹配(fuzzy match)**发生在翻译记忆(TM)包含与正在翻译的源文本相似但不完全相同的片段时。与100%匹配(精确匹配)不同,模糊匹配需要翻译人员审核并调整建议的译文以适应新的上下文。
模糊匹配百分比通常在50%到99%之间,表示存储片段与当前源文本的相似程度。
匹配百分比级别
匹配类型
| 匹配级别 | 描述 | 译者操作 |
|---|---|---|
| 100%(精确) | 完全相同的源文本 | 核实,通常接受 |
| 101%(上下文) | 100% + 相同的周围文本 | 最高置信度 |
| 95-99% | 非常相似,细微差异 | 快速编辑 |
| 85-94% | 相似,需要一些更改 | 中度编辑 |
| 75-84% | 部分相似 | 大量编辑 |
| 50-74% | 低相似度 | 大幅编辑或重新翻译 |
| <50% | 最小相似度 | 通常不显示 |
模糊匹配示例
原始TM条目(100%):
"点击保存按钮以保存您的更改。"
新源文本 vs TM匹配:
| 新文本 | 匹配% | 差异 |
|---|---|---|
| "点击保存按钮以保存您的更改。" | 100% | 无 |
| "点击提交按钮以保存您的更改。" | 92% | 一个词 |
| "点击保存按钮以应用您的更改。" | 88% | 一个词 |
| "点击确定按钮以确认您的更改。" | 78% | 两个词 |
| "选择保存以存储更改。" | 65% | 结构重组 |
模糊匹配的工作原理
算法基础
CAT工具使用各种算法来计算相似度:
莱文斯坦距离
- 计算最小编辑次数(插入、删除、替换)
- 字符级或词级比较
基于词元的匹配
- 比较单个词/词元
- 考虑词序
N-gram分析
- 比较字符/词的序列
- 对结构变化更有效
计算示例
源文:保存文档后再关闭
TM: 保存文件后再关闭
词元匹配:4/5 = 80%
考虑词重要性权重:~85%
模糊匹配定价
行业标准费率
| 匹配范围 | 典型折扣 |
|---|---|
| 100% | 70-90% |
| 95-99% | 50-75% |
| 85-94% | 30-50% |
| 75-84% | 15-30% |
| 50-74% | 0-15% |
| 无匹配 | 全价 |
定价考虑因素
- 更高的匹配 = 更少的编辑工作
- TM质量影响实际工作量
- 领域复杂性很重要
- 部分客户协商不同的区间
使用模糊匹配
译者最佳实践
始终审核
- 切勿盲目接受模糊匹配
- 检查细微的含义变化
- 验证术语一致性
高效编辑
- 关注高亮显示的差异
- 使用CAT工具的比较视图
- 利用语料库搜索
常见陷阱
- 对高百分比的错误信心
- 遗漏上下文变化
- 忽略数字/日期差异
模糊匹配惩罚
CAT工具可以应用惩罚来降低匹配分数:
常见惩罚类型
| 惩罚类型 | 目的 | 典型降低 |
|---|---|---|
| 不同TM | 较低信任来源 | -5到-10% |
| 旧译文 | 过时内容 | -5% |
| 不同项目 | 上下文不匹配 | -3到-5% |
| 不同文件类型 | 格式问题 | -2到-5% |
| 机器来源 | MT生成 | -10到-20% |
模糊匹配阈值
配置最小阈值
| 设置 | 效果 |
|---|---|
| 最低70% | 显示更多建议,更多噪音 |
| 最低75% | 平衡,常见默认值 |
| 最低80% | 更少但更高质量的匹配 |
| 最低85% | 保守,只有有用的匹配 |
对生产力的影响
按匹配级别的生产力提升
| 匹配级别 | 词/小时增加 |
|---|---|
| 100% | +300-400% |
| 95-99% | +200-300% |
| 85-94% | +100-150% |
| 75-84% | +50-75% |
| 无匹配 | 基准 |
常见问题
什么是好的模糊匹配百分比?
75%以上的匹配通常有用。85%+的匹配提供显著的生产力优势。低于75%,编辑工作量可能等于或超过从头翻译。
高模糊匹配是否应该不审核就接受?
不应该。即使99%的匹配也可能有关键差异——一个更改的词可能完全改变含义。无论百分比多少,始终审核模糊匹配。
CAT工具如何计算模糊匹配百分比?
不同工具使用不同的算法(莱文斯坦距离、词元匹配、n-gram)。同一片段对在不同工具中可能显示不同的百分比。关注实际差异,而不仅仅是数字。
模糊匹配会引入错误吗?
会的。常见问题包括:
- 接受不适当的匹配
- 遗漏细微的含义变化
- 传播原始译文的错误
- 术语不一致
模糊匹配如何影响翻译记忆的建设?
当您编辑模糊匹配并确认时,新片段通常会添加到TM中。随着时间推移,这为以前只有模糊匹配的内容建立了精确匹配。
模糊匹配和机器翻译有什么区别?
模糊匹配来自TM中的人工翻译内容。机器翻译由AI/算法生成。模糊匹配通常更可靠,但仅限于相似的以前翻译过的内容。
