Что такое GEMBA?
GEMBA (GPT Estimation Metric Based Assessment) — семейство методов оценки качества машинного перевода, в которых оценщиком выступает большая языковая модель, а не специально обученная под эту узкую задачу сеть вроде COMET. Вместо отдельного этапа обучения GEMBA просто формулирует задачу оценки как промпт для LLM: покажи модели исходник и перевод, попроси оценить.
Это был первый широко признанный подход, показавший, что готовая языковая модель без дополнительного обучения справляется с оценкой перевода на уровне специализированных метрик или лучше.
Три варианта GEMBA
- GEMBA-DA — модель выдаёт единственную числовую оценку качества (Direct Assessment), аналогично тому, как оценивал бы перевод человек-эксперт по шкале
- GEMBA-ESA — модель размечает конкретные проблемные фрагменты (Error Span Annotation) и на основе разметки выводит итоговую оценку
- GEMBA-MQM — модель классифицирует найденные ошибки по типу и критичности в логике MQM, то есть выдаёт не просто число, а структурированную разметку, совместимую с человеческой методологией оценки
GEMBA-MQM — самый информативный из трёх вариантов: он не просто говорит «перевод так себе», а объясняет, что именно не так и насколько это серьёзно.
Как работает GEMBA-MQM на практике
Модели передаётся исходный текст, перевод и инструкция классифицировать ошибки по категориям MQM (точность, беглость, терминология, стиль) с указанием критичности каждой. Результат — список найденных проблем, который можно агрегировать в числовую оценку по той же формуле, что используется в ручной MQM-оценке, и таким образом сравнивать LLM-разметку с работой человека-редактора напрямую.
GEMBA и рутинная работа с сегментами
Сегменты, которые GEMBA(-MQM) не смогла обработать или пропустила по таймауту, требуют явной политики: не проверенный сегмент — это не то же самое, что проверенный без замечаний. Смешивать эти два случая в одну «отличную» оценку — распространённая и опасная ошибка отчётности, потому что итоговый средний балл начинает показывать долю пропусков, а не реальное качество.
GEMBA vs COMET: когда что выбирать
| GEMBA | COMET | |
|---|---|---|
| Что нужно | Доступ к LLM и промпт | Специально обученная модель |
| Стоимость запуска | Выше — полноценный вызов LLM на сегмент | Ниже |
| Детализация результата | Может дать разметку по типам ошибок (GEMBA-MQM) | Обычно только число |
| Гибкость под задачу | Высокая — правится промптом | Низкая — модель обучена один раз |
Комбинация распространена: COMET быстро отсеивает явно хорошие сегменты, GEMBA-MQM разбирает то, что осталось, подробно.
Ограничения
Оценка через LLM наследует все слепые пятна самой модели: если модель плохо понимает редкий язык или узкую предметную область, её оценка перевода в этой области тоже будет ненадёжной. LLM-судья также может быть непоследователен между запусками без фиксации температуры и версии модели, что важно учитывать при сравнении оценок во времени.
FAQ
Чем GEMBA отличается от обычного QE?
GEMBA — это конкретный подход внутри более широкого термина QE, использующий готовую LLM в роли эксперта вместо специально обученной метрики.
Какой вариант GEMBA самый полезный?
GEMBA-MQM — потому что даёт не только оценку, но и объяснение, какие именно ошибки найдены и насколько они серьёзны.
Нужен ли GEMBA эталонный перевод?
Нет, GEMBA обычно работает в безэталонном режиме, оценивая пару «исходник — перевод» напрямую, хотя формат допускает и режим с эталоном.
Пропущенный сегмент — это низкая оценка?
Нет, и здесь легко ошибиться в отчётности: пропуск (не оценено) и низкая оценка (оценено и найдены проблемы) — разные состояния, которые нужно считать раздельно.
Можно ли доверять оценке GEMBA как единственному критерию?
Для мониторинга потока — да. Для решений с высокой ценой ошибки GEMBA-разметку обычно перепроверяет человек, особенно на границе между «серьёзной» и «незначительной» ошибкой.
