Skip to main content
Назад к глоссарию
Термин глоссария

GEMBA (оценка перевода силами LLM)

Аббревиатура: GEMBA

GEMBA — способ оценивать перевод, задавая большой языковой модели вопрос о его качестве напрямую, без специально обученной под эту задачу метрики.

3 мин чтения
quality-assessmentLLM-as-a-judgeоценка перевода

Что такое GEMBA?

GEMBA (GPT Estimation Metric Based Assessment) — семейство методов оценки качества машинного перевода, в которых оценщиком выступает большая языковая модель, а не специально обученная под эту узкую задачу сеть вроде COMET. Вместо отдельного этапа обучения GEMBA просто формулирует задачу оценки как промпт для LLM: покажи модели исходник и перевод, попроси оценить.

Это был первый широко признанный подход, показавший, что готовая языковая модель без дополнительного обучения справляется с оценкой перевода на уровне специализированных метрик или лучше.

Три варианта GEMBA

  • GEMBA-DA — модель выдаёт единственную числовую оценку качества (Direct Assessment), аналогично тому, как оценивал бы перевод человек-эксперт по шкале
  • GEMBA-ESA — модель размечает конкретные проблемные фрагменты (Error Span Annotation) и на основе разметки выводит итоговую оценку
  • GEMBA-MQM — модель классифицирует найденные ошибки по типу и критичности в логике MQM, то есть выдаёт не просто число, а структурированную разметку, совместимую с человеческой методологией оценки

GEMBA-MQM — самый информативный из трёх вариантов: он не просто говорит «перевод так себе», а объясняет, что именно не так и насколько это серьёзно.

Как работает GEMBA-MQM на практике

Модели передаётся исходный текст, перевод и инструкция классифицировать ошибки по категориям MQM (точность, беглость, терминология, стиль) с указанием критичности каждой. Результат — список найденных проблем, который можно агрегировать в числовую оценку по той же формуле, что используется в ручной MQM-оценке, и таким образом сравнивать LLM-разметку с работой человека-редактора напрямую.

GEMBA и рутинная работа с сегментами

Сегменты, которые GEMBA(-MQM) не смогла обработать или пропустила по таймауту, требуют явной политики: не проверенный сегмент — это не то же самое, что проверенный без замечаний. Смешивать эти два случая в одну «отличную» оценку — распространённая и опасная ошибка отчётности, потому что итоговый средний балл начинает показывать долю пропусков, а не реальное качество.

GEMBA vs COMET: когда что выбирать

GEMBACOMET
Что нужноДоступ к LLM и промптСпециально обученная модель
Стоимость запускаВыше — полноценный вызов LLM на сегментНиже
Детализация результатаМожет дать разметку по типам ошибок (GEMBA-MQM)Обычно только число
Гибкость под задачуВысокая — правится промптомНизкая — модель обучена один раз

Комбинация распространена: COMET быстро отсеивает явно хорошие сегменты, GEMBA-MQM разбирает то, что осталось, подробно.

Ограничения

Оценка через LLM наследует все слепые пятна самой модели: если модель плохо понимает редкий язык или узкую предметную область, её оценка перевода в этой области тоже будет ненадёжной. LLM-судья также может быть непоследователен между запусками без фиксации температуры и версии модели, что важно учитывать при сравнении оценок во времени.

FAQ

Чем GEMBA отличается от обычного QE?

GEMBA — это конкретный подход внутри более широкого термина QE, использующий готовую LLM в роли эксперта вместо специально обученной метрики.

Какой вариант GEMBA самый полезный?

GEMBA-MQM — потому что даёт не только оценку, но и объяснение, какие именно ошибки найдены и насколько они серьёзны.

Нужен ли GEMBA эталонный перевод?

Нет, GEMBA обычно работает в безэталонном режиме, оценивая пару «исходник — перевод» напрямую, хотя формат допускает и режим с эталоном.

Пропущенный сегмент — это низкая оценка?

Нет, и здесь легко ошибиться в отчётности: пропуск (не оценено) и низкая оценка (оценено и найдены проблемы) — разные состояния, которые нужно считать раздельно.

Можно ли доверять оценке GEMBA как единственному критерию?

Для мониторинга потока — да. Для решений с высокой ценой ошибки GEMBA-разметку обычно перепроверяет человек, особенно на границе между «серьёзной» и «незначительной» ошибкой.

Связанные термины

Часто задаваемые вопросы

Чем GEMBA отличается от обычного QE?

GEMBA — это конкретный подход внутри более широкого термина **[QE](/glossary/qe)**, использующий готовую LLM в роли эксперта вместо специально обученной метрики.

Какой вариант GEMBA самый полезный?

GEMBA-MQM — потому что даёт не только оценку, но и объяснение, какие именно ошибки найдены и насколько они серьёзны.

Нужен ли GEMBA эталонный перевод?

Нет, GEMBA обычно работает в безэталонном режиме, оценивая пару «исходник — перевод» напрямую, хотя формат допускает и режим с эталоном.

Пропущенный сегмент — это низкая оценка?

Нет, и здесь легко ошибиться в отчётности: пропуск (не оценено) и низкая оценка (оценено и найдены проблемы) — разные состояния, которые нужно считать раздельно.

Можно ли доверять оценке GEMBA как единственному критерию?

Для мониторинга потока — да. Для решений с высокой ценой ошибки GEMBA-разметку обычно перепроверяет человек, особенно на границе между «серьёзной» и «незначительной» ошибкой.

KTTC Team
3 мин чтения

We use cookies to improve your experience. Learn more in our Cookie Policy.