Skip to main content
Назад к глоссарию
Термин глоссария

COMET (нейросетевая метрика качества перевода)

Аббревиатура: COMET

COMET — обученная на человеческих оценках нейросетевая модель, которая оценивает качество перевода точнее классических метрик вроде BLEU, в том числе без эталонного перевода.

3 мин чтения
quality-assessmentнейросетевые метрикиоценка перевода

Что такое COMET?

COMET (Crosslingual Optimized Metric for Evaluation of Translation) — нейросетевая модель для оценки качества перевода. В отличие от BLEU, который просто считает совпадение слов с эталоном, COMET обучен на массиве переводов с человеческими оценками и научился предсказывать эту оценку, опираясь на смысловое сходство, а не на буквальное совпадение текста.

Два режима работы

COMET-22 — базовый вариант, которому для оценки всё ещё нужен эталонный перевод, написанный человеком, хотя сравнение идёт по смыслу, а не по словам.

COMETKiwi — reference-free вариант, работающий без эталона вообще: модель оценивает пару «исходник — перевод» напрямую. Это именно та часть COMET, которую обычно имеют в виду, говоря о MTQE.

Почему COMET точнее BLEU

BLEU штрафует любую перефразировку, даже если смысл передан верно — совпадение считается по словам и словосочетаниям. COMET обучен на смысловом сходстве и не наказывает перевод за то, что он сказал то же самое другими словами. Это особенно важно для языков с гибким порядком слов и для оценки перевода, сделанного современными LLM, которые часто перефразируют вместо дословной передачи.

Как использовать оценку COMET

Оценка COMET обычно лежит в диапазоне примерно от 0 до 1 (иногда выражается в шкале 0–100) и интерпретируется относительно, а не абсолютно — важно сравнение между системами или между версиями одной системы на одном и том же наборе текстов, а не единичное число само по себе. Типичное применение:

  • Сравнение нескольких систем перевода между собой на одном тестовом наборе
  • Отслеживание качества одной системы перевода во времени
  • Приоритизация сегментов для постредактирования при отсутствии эталона (через COMETKiwi)

COMET vs GEMBA

COMETGEMBA
Тип моделиСпециально обученная под оценку сетьУниверсальная LLM в роли судьи
Что выдаётЧисловую оценкуОценку и/или разметку ошибок по типу MQM
Требует ли эталонНе обязательно (COMETKiwi)Не обязательно
Стоимость запускаНижеВыше (полноценный вызов LLM)

Актуальный подход 2026 года не выбирает одно вместо другого — COMET даёт быстрый и дешёвый первый сигнал, GEMBA или другой LLM-судья добавляет более тонкую разметку там, где это оправдано.

Ограничения

COMET, как и любая обученная модель, наследует слепые пятна своей обучающей выборки — на редких языковых парах или узкой терминологии его предсказания менее надёжны. Числовая оценка COMET также не заменяет MQM-совместимую разметку ошибок там, где заказчику нужно понимать не только «насколько хорошо», но и «что именно не так».

FAQ

Нужен ли COMET эталонный перевод?

В базовом варианте COMET-22 — да. В reference-free варианте COMETKiwi — нет, модель оценивает пару «исходник — перевод» напрямую.

Чем COMET лучше BLEU?

COMET оценивает смысловое сходство, а не совпадение слов, поэтому не штрафует корректную перефразировку и лучше коррелирует с оценкой человека.

Можно ли использовать COMET как единственную метрику?

Для мониторинга и сравнения систем — да. Для финального решения по тексту с высокой ценой ошибки COMET дополняют проверкой человека или LLM-судьёй с разметкой ошибок.

Как интерпретировать конкретное число COMET?

Как относительную величину: важно сравнение между системами или во времени на одном наборе текстов, а не абсолютный порог «хорошо/плохо».

COMET и GEMBA — конкурирующие подходы?

Нет, взаимодополняющие: COMET дешевле и быстрее как первый сигнал, GEMBA (или другой LLM-судья) добавляет разметку по типу ошибок там, где нужна более тонкая картина, а не только число.

Связанные термины

Часто задаваемые вопросы

Нужен ли COMET эталонный перевод?

В базовом варианте COMET-22 — да. В reference-free варианте COMETKiwi — нет, модель оценивает пару «исходник — перевод» напрямую.

Чем COMET лучше BLEU?

COMET оценивает смысловое сходство, а не совпадение слов, поэтому не штрафует корректную перефразировку и лучше коррелирует с оценкой человека.

Можно ли использовать COMET как единственную метрику?

Для мониторинга и сравнения систем — да. Для финального решения по тексту с высокой ценой ошибки COMET дополняют проверкой человека или LLM-судьёй с разметкой ошибок.

Как интерпретировать конкретное число COMET?

Как относительную величину: важно сравнение между системами или во времени на одном наборе текстов, а не абсолютный порог «хорошо/плохо».

COMET и GEMBA — конкурирующие подходы?

Нет, взаимодополняющие: COMET дешевле и быстрее как первый сигнал, GEMBA (или другой LLM-судья) добавляет разметку по типу ошибок там, где нужна более тонкая картина, а не только число.

KTTC Team
3 мин чтения

We use cookies to improve your experience. Learn more in our Cookie Policy.