Что такое COMET?
COMET (Crosslingual Optimized Metric for Evaluation of Translation) — нейросетевая модель для оценки качества перевода. В отличие от BLEU, который просто считает совпадение слов с эталоном, COMET обучен на массиве переводов с человеческими оценками и научился предсказывать эту оценку, опираясь на смысловое сходство, а не на буквальное совпадение текста.
Два режима работы
COMET-22 — базовый вариант, которому для оценки всё ещё нужен эталонный перевод, написанный человеком, хотя сравнение идёт по смыслу, а не по словам.
COMETKiwi — reference-free вариант, работающий без эталона вообще: модель оценивает пару «исходник — перевод» напрямую. Это именно та часть COMET, которую обычно имеют в виду, говоря о MTQE.
Почему COMET точнее BLEU
BLEU штрафует любую перефразировку, даже если смысл передан верно — совпадение считается по словам и словосочетаниям. COMET обучен на смысловом сходстве и не наказывает перевод за то, что он сказал то же самое другими словами. Это особенно важно для языков с гибким порядком слов и для оценки перевода, сделанного современными LLM, которые часто перефразируют вместо дословной передачи.
Как использовать оценку COMET
Оценка COMET обычно лежит в диапазоне примерно от 0 до 1 (иногда выражается в шкале 0–100) и интерпретируется относительно, а не абсолютно — важно сравнение между системами или между версиями одной системы на одном и том же наборе текстов, а не единичное число само по себе. Типичное применение:
- Сравнение нескольких систем перевода между собой на одном тестовом наборе
- Отслеживание качества одной системы перевода во времени
- Приоритизация сегментов для постредактирования при отсутствии эталона (через COMETKiwi)
COMET vs GEMBA
| COMET | GEMBA | |
|---|---|---|
| Тип модели | Специально обученная под оценку сеть | Универсальная LLM в роли судьи |
| Что выдаёт | Числовую оценку | Оценку и/или разметку ошибок по типу MQM |
| Требует ли эталон | Не обязательно (COMETKiwi) | Не обязательно |
| Стоимость запуска | Ниже | Выше (полноценный вызов LLM) |
Актуальный подход 2026 года не выбирает одно вместо другого — COMET даёт быстрый и дешёвый первый сигнал, GEMBA или другой LLM-судья добавляет более тонкую разметку там, где это оправдано.
Ограничения
COMET, как и любая обученная модель, наследует слепые пятна своей обучающей выборки — на редких языковых парах или узкой терминологии его предсказания менее надёжны. Числовая оценка COMET также не заменяет MQM-совместимую разметку ошибок там, где заказчику нужно понимать не только «насколько хорошо», но и «что именно не так».
FAQ
Нужен ли COMET эталонный перевод?
В базовом варианте COMET-22 — да. В reference-free варианте COMETKiwi — нет, модель оценивает пару «исходник — перевод» напрямую.
Чем COMET лучше BLEU?
COMET оценивает смысловое сходство, а не совпадение слов, поэтому не штрафует корректную перефразировку и лучше коррелирует с оценкой человека.
Можно ли использовать COMET как единственную метрику?
Для мониторинга и сравнения систем — да. Для финального решения по тексту с высокой ценой ошибки COMET дополняют проверкой человека или LLM-судьёй с разметкой ошибок.
Как интерпретировать конкретное число COMET?
Как относительную величину: важно сравнение между системами или во времени на одном наборе текстов, а не абсолютный порог «хорошо/плохо».
COMET и GEMBA — конкурирующие подходы?
Нет, взаимодополняющие: COMET дешевле и быстрее как первый сигнал, GEMBA (или другой LLM-судья) добавляет разметку по типу ошибок там, где нужна более тонкая картина, а не только число.
