Skip to main content
Назад к глоссарию
Термин глоссария

BLEU (метрика совпадения n-грамм)

Аббревиатура: BLEU

BLEU — старейшая широко используемая метрика оценки машинного перевода: она считает, насколько перевод совпадает с эталонным по словам и словосочетаниям.

3 мин чтения
quality-assessmentклассические метрикиn-граммы

Что такое BLEU?

BLEU (Bilingual Evaluation Understudy) — метрика оценки качества машинного перевода, предложенная в 2002 году и на десятилетия ставшая отраслевым стандартом. BLEU сравнивает машинный перевод с одним или несколькими эталонными переводами, написанными человеком, и считает долю совпадающих n-грамм — последовательностей из одного, двух, трёх и четырёх слов подряд.

Итоговая оценка — число от 0 до 100 (или от 0 до 1): чем больше совпадений, тем выше оценка.

Как считается BLEU

Упрощённо: метрика берёт перевод, разбивает его на n-граммы разной длины, проверяет, сколько из них встречается в эталонном переводе, и штрафует слишком короткие переводы отдельным коэффициентом (brevity penalty), чтобы модель не могла завысить оценку, просто выдавая короткие, но частично совпадающие фрагменты.

Почему BLEU перестал быть достаточным

Главная проблема BLEU — он оценивает буквальное совпадение, а не смысл. Правильный перевод, сформулированный другими словами, чем эталон, получит низкую оценку, а неудачный перевод, случайно совпавший по словам с эталоном, — высокую. Это особенно заметно на переводах, сделанных современными LLM: они склонны перефразировать, и BLEU систематически недооценивает их качество по сравнению с оценкой человека.

Дополнительная проблема — BLEU требует эталонного перевода для каждого текста, которого часто просто не существует.

BLEU vs COMET

BLEUCOMET
Год появления20022020
Что сравниваетБуквальное совпадение словСмысловое сходство
Нужен эталонДа, всегдаНе обязательно (COMETKiwi)
Корреляция с человекомУмереннаяВысокая
Актуальность в 2026Историческая, для сравнения со старыми замерамиОсновная

BLEU не исчез полностью — он остаётся полезным для быстрого грубого сравнения и там, где важна сопоставимость с многолетними историческими данными, собранными именно на этой метрике.

Когда BLEU всё ещё используют

  • Сравнение с академическими бенчмарками, где исторически отчитывались именно в BLEU
  • Быстрая грубая проверка на этапе разработки, до более дорогой оценки через COMET или GEMBA
  • Учебные и демонстрационные цели — метрика проста для объяснения

FAQ

BLEU всё ещё используется в индустрии?

Как основная метрика приёмки — редко. Как один из нескольких сигналов при сравнении систем или для сопоставимости с историческими данными — да.

Какое значение BLEU считается хорошим?

Сильно зависит от языковой пары и типа текста, единого порога нет; для похожих по структуре языков и качественного перевода типичны более высокие значения, чем для языковых пар с сильно различающейся грамматикой.

Почему BLEU занижает оценку хорошим LLM-переводам?

Потому что современные LLM чаще перефразируют, чем переводят дословно, а BLEU считает именно дословное совпадение — корректная, но непохожая на эталон формулировка получает штраф.

Чем BLEU отличается от chrF?

chrF считает совпадение по символам, а не по словам, что делает его устойчивее к морфологическим различиям в языках с богатым словоизменением — но он всё равно оценивает буквальное совпадение, а не смысл, в отличие от COMET.

Нужен ли BLEU для оценки перевода документов KTTC?

Нет: для оценки перевода документов больше подходят методы, не требующие эталона на каждый уникальный документ, — именно поэтому индустрия ушла от BLEU к безэталонным подходам вроде MTQE.

Связанные термины

Часто задаваемые вопросы

BLEU всё ещё используется в индустрии?

Как основная метрика приёмки — редко. Как один из нескольких сигналов при сравнении систем или для сопоставимости с историческими данными — да.

Какое значение BLEU считается хорошим?

Сильно зависит от языковой пары и типа текста, единого порога нет; для похожих по структуре языков и качественного перевода типичны более высокие значения, чем для языковых пар с сильно различающейся грамматикой.

Почему BLEU занижает оценку хорошим LLM-переводам?

Потому что современные LLM чаще перефразируют, чем переводят дословно, а BLEU считает именно дословное совпадение — корректная, но непохожая на эталон формулировка получает штраф.

Чем BLEU отличается от chrF?

chrF считает совпадение по символам, а не по словам, что делает его устойчивее к морфологическим различиям в языках с богатым словоизменением — но он всё равно оценивает буквальное совпадение, а не смысл, в отличие от COMET.

Нужен ли BLEU для оценки перевода документов KTTC?

Нет: для оценки перевода документов больше подходят методы, не требующие эталона на каждый уникальный документ, — именно поэтому индустрия ушла от BLEU к безэталонным подходам вроде **[MTQE](/glossary/mtqe)**.

KTTC Team
3 мин чтения

We use cookies to improve your experience. Learn more in our Cookie Policy.