Что такое BLEU?
BLEU (Bilingual Evaluation Understudy) — метрика оценки качества машинного перевода, предложенная в 2002 году и на десятилетия ставшая отраслевым стандартом. BLEU сравнивает машинный перевод с одним или несколькими эталонными переводами, написанными человеком, и считает долю совпадающих n-грамм — последовательностей из одного, двух, трёх и четырёх слов подряд.
Итоговая оценка — число от 0 до 100 (или от 0 до 1): чем больше совпадений, тем выше оценка.
Как считается BLEU
Упрощённо: метрика берёт перевод, разбивает его на n-граммы разной длины, проверяет, сколько из них встречается в эталонном переводе, и штрафует слишком короткие переводы отдельным коэффициентом (brevity penalty), чтобы модель не могла завысить оценку, просто выдавая короткие, но частично совпадающие фрагменты.
Почему BLEU перестал быть достаточным
Главная проблема BLEU — он оценивает буквальное совпадение, а не смысл. Правильный перевод, сформулированный другими словами, чем эталон, получит низкую оценку, а неудачный перевод, случайно совпавший по словам с эталоном, — высокую. Это особенно заметно на переводах, сделанных современными LLM: они склонны перефразировать, и BLEU систематически недооценивает их качество по сравнению с оценкой человека.
Дополнительная проблема — BLEU требует эталонного перевода для каждого текста, которого часто просто не существует.
BLEU vs COMET
| BLEU | COMET | |
|---|---|---|
| Год появления | 2002 | 2020 |
| Что сравнивает | Буквальное совпадение слов | Смысловое сходство |
| Нужен эталон | Да, всегда | Не обязательно (COMETKiwi) |
| Корреляция с человеком | Умеренная | Высокая |
| Актуальность в 2026 | Историческая, для сравнения со старыми замерами | Основная |
BLEU не исчез полностью — он остаётся полезным для быстрого грубого сравнения и там, где важна сопоставимость с многолетними историческими данными, собранными именно на этой метрике.
Когда BLEU всё ещё используют
- Сравнение с академическими бенчмарками, где исторически отчитывались именно в BLEU
- Быстрая грубая проверка на этапе разработки, до более дорогой оценки через COMET или GEMBA
- Учебные и демонстрационные цели — метрика проста для объяснения
FAQ
BLEU всё ещё используется в индустрии?
Как основная метрика приёмки — редко. Как один из нескольких сигналов при сравнении систем или для сопоставимости с историческими данными — да.
Какое значение BLEU считается хорошим?
Сильно зависит от языковой пары и типа текста, единого порога нет; для похожих по структуре языков и качественного перевода типичны более высокие значения, чем для языковых пар с сильно различающейся грамматикой.
Почему BLEU занижает оценку хорошим LLM-переводам?
Потому что современные LLM чаще перефразируют, чем переводят дословно, а BLEU считает именно дословное совпадение — корректная, но непохожая на эталон формулировка получает штраф.
Чем BLEU отличается от chrF?
chrF считает совпадение по символам, а не по словам, что делает его устойчивее к морфологическим различиям в языках с богатым словоизменением — но он всё равно оценивает буквальное совпадение, а не смысл, в отличие от COMET.
Нужен ли BLEU для оценки перевода документов KTTC?
Нет: для оценки перевода документов больше подходят методы, не требующие эталона на каждый уникальный документ, — именно поэтому индустрия ушла от BLEU к безэталонным подходам вроде MTQE.
