什么是BLEU?
**BLEU(Bilingual Evaluation Understudy)**是2002年提出的机器翻译质量指标,此后数十年一直是行业标准。BLEU将机器译文与一份或多份人工撰写的参考译文进行比较,统计匹配的n-gram(连续1到4个词的序列)比例。
最终分数是0到100(或0到1)之间的数字:重合度越高,分数越高。
BLEU如何计算
简单来说:该指标将译文拆分成不同长度的n-gram,检查其中有多少出现在参考译文中,并对过短的译文施加单独的简短惩罚(brevity penalty),防止模型靠输出简短但部分重合的片段来虚抬分数。
为什么BLEU已不够用
BLEU的核心问题在于它衡量的是字面重合度,而非语义。用不同措辞正确表达原意的译文会得低分,而恰好在用词上与参考译文重合的糟糕译文却能得高分。这一点在评估现代LLM的译文时尤为明显——LLM更倾向于改写而非逐字翻译,BLEU因此系统性地低估了它们相对于人工判断的质量。
另一个问题是:BLEU要求每份文本都有参考译文,而这种参考译文往往根本不存在。
BLEU与COMET的区别
| BLEU | COMET | |
|---|---|---|
| 提出年份 | 2002 | 2020 |
| 比较对象 | 字面词语重合度 | 语义相似度 |
| 是否需要参考译文 | 需要,始终如此 | 不一定(COMETKiwi) |
| 与人工判断的相关性 | 中等 | 较高 |
| 2026年的适用性 | 历史性,用于与旧基准比较 | 主流方法 |
BLEU并未完全消失——在快速粗略比较的场合,以及需要与多年历史上以BLEU上报的数据保持可比性的场合,它仍然有用。
BLEU仍被使用的场景
常见问题
BLEU在业界还在使用吗?
作为主要验收指标——很少见了。作为比较系统时的多个信号之一,或用于与历史数据保持可比性——是的。
BLEU分数多少算好?
很大程度上取决于语言对和文本类型,没有统一门槛;结构相似的语言在译文质量良好时,分数通常高于语法差异很大的语言对。
为什么BLEU会低估优质的LLM译文?
因为现代LLM更倾向于改写而非逐字翻译,而BLEU统计的恰恰是这种字面重合度——措辞正确但与参考译文不同的表达会因此被扣分。
BLEU与chrF有什么区别?
chrF统计的是字符层面而非词语层面的重合度,这使它对形态变化丰富的语言更具鲁棒性——但与COMET不同,它衡量的仍是字面重合度而非语义。
评估KTTC的文档翻译需要用到BLEU吗?
不需要:评估文档翻译更适合采用无需为每份独特文档准备参考译文的方法——这正是业界从BLEU转向**MTQE**等无参考方法的原因。
