Skip to main content
返回术语表
术语

BLEU(N-gram重合度指标)

缩写: BLEU

BLEU是最古老、应用最广泛的机器翻译评估指标:它逐词逐短语统计译文与参考译文的重合程度。

3 分钟阅读
质量评估经典指标N-gram

什么是BLEU?

**BLEU(Bilingual Evaluation Understudy)**是2002年提出的机器翻译质量指标,此后数十年一直是行业标准。BLEU将机器译文与一份或多份人工撰写的参考译文进行比较,统计匹配的n-gram(连续1到4个词的序列)比例。

最终分数是0到100(或0到1)之间的数字:重合度越高,分数越高。

BLEU如何计算

简单来说:该指标将译文拆分成不同长度的n-gram,检查其中有多少出现在参考译文中,并对过短的译文施加单独的简短惩罚(brevity penalty),防止模型靠输出简短但部分重合的片段来虚抬分数。

为什么BLEU已不够用

BLEU的核心问题在于它衡量的是字面重合度,而非语义。用不同措辞正确表达原意的译文会得低分,而恰好在用词上与参考译文重合的糟糕译文却能得高分。这一点在评估现代LLM的译文时尤为明显——LLM更倾向于改写而非逐字翻译,BLEU因此系统性地低估了它们相对于人工判断的质量。

另一个问题是:BLEU要求每份文本都有参考译文,而这种参考译文往往根本不存在。

BLEU与COMET的区别

BLEUCOMET
提出年份20022020
比较对象字面词语重合度语义相似度
是否需要参考译文需要,始终如此不一定(COMETKiwi)
与人工判断的相关性中等较高
2026年的适用性历史性,用于与旧基准比较主流方法

BLEU并未完全消失——在快速粗略比较的场合,以及需要与多年历史上以BLEU上报的数据保持可比性的场合,它仍然有用。

BLEU仍被使用的场景

  • 与历来以BLEU汇报成绩的学术基准进行比较
  • 在开发阶段进行快速粗筛,再交由**COMETGEMBA**做成本更高的评估
  • 教学与演示用途——该指标便于解释

常见问题

BLEU在业界还在使用吗?

作为主要验收指标——很少见了。作为比较系统时的多个信号之一,或用于与历史数据保持可比性——是的。

BLEU分数多少算好?

很大程度上取决于语言对和文本类型,没有统一门槛;结构相似的语言在译文质量良好时,分数通常高于语法差异很大的语言对。

为什么BLEU会低估优质的LLM译文?

因为现代LLM更倾向于改写而非逐字翻译,而BLEU统计的恰恰是这种字面重合度——措辞正确但与参考译文不同的表达会因此被扣分。

BLEU与chrF有什么区别?

chrF统计的是字符层面而非词语层面的重合度,这使它对形态变化丰富的语言更具鲁棒性——但与COMET不同,它衡量的仍是字面重合度而非语义。

评估KTTC的文档翻译需要用到BLEU吗?

不需要:评估文档翻译更适合采用无需为每份独特文档准备参考译文的方法——这正是业界从BLEU转向**MTQE**等无参考方法的原因。

相关术语

KTTC团队
3分钟阅读

We use cookies to improve your experience. Learn more in our Cookie Policy.