Оценка перевода без эталона: что после GEMBA-MQM
В проде эталонного перевода нет. Есть исходник, есть перевод и есть решение: годится ли перевод к отгрузке. Все метрики, построенные на сравнении с человеческим переводом — BLEU, chrF, COMET в референсной форме, — недоступны ровно в тот момент, когда число нужно.
Ответ — оценка качества без эталона, и она уже достаточно хороша, чтобы по ней действовать. Ниже: что изменилось в 2025–2026, что воспроизводимо на платных API, а что требует своей инфраструктуры, и наш собственный отказ — оценка качества, месяцами возвращавшая правдоподобное число и не делавшая ничего.
На чём остановилась GEMBA-MQM
GEMBA-MQM просит языковую модель сыграть MQM-аннотатора: найди ошибки в этом переводе, классифицируй каждую по категории и серьёзности, — а балл выпадает из взвешенного счёта ошибок. Работает потому, что модель делает то же, что делают аннотаторы, а не оценивает похожесть.
Настоящее её достоинство — проверяемость вывода. Число без списка ошибок это мнение; GEMBA-MQM выдаёт «серьёзная ошибка точности вот на этом фрагменте», с чем ревьюер может согласиться или не согласиться. Для перевода документов это важнее десятой доли корреляции: ревьюер всё равно следующий шаг.
Что добавили 2025–2026
GEMBA V2 (WMT25) сохраняет промптинг и бьёт по дисперсии. Одиночное суждение модели шумное — запустите дважды, получите два балла. V2 сэмплирует суждение примерно десятикратно и агрегирует ранговым взвешенным средним вместо обычного, чтобы один дикий сэмпл не утащил результат. Корреляция лучше, цена примерно вдесятеро.
MetricX-25 — обученная метрика, а не промптовая, и на бенчмарках она точнее. Загвоздка операционная: это модель, которую вы хостите, со всеми вытекающими GPU, развёртыванием и управлением версиями.
Практическое разделение, если вы на платных API и не хотите эксплуатировать модель:
| Воспроизводимо на API | Нужна своя инфраструктура | |
|---|---|---|
| GEMBA-MQM | Да | — |
| Сэмплирование GEMBA V2 | Да, ценой ~10× | — |
| MetricX-25 | — | Да |
| Правиловые эвристики | Да, ~бесплатно | — |
Наш вывод: сэмплирование V2 окупается выборочно, на сегментах, которые уже пометил дешёвый ярус, а не по умолчанию, — по арифметической причине: десять суждений о сегменте, который никто не собирался править, это десять потраченных зря вызовов.
Двухъярусная схема, которая действительно окупается
Схема, которую мы гоняем и которую рекомендуем:
Ярус 1: правиловый, на всём. Отношения длин, детект непереведённого исходника, наличие чисел и терминов глоссария, единство письменности. Стоит нисколько, работает за миллисекунды и ловит дефекты, которые на официальных документах и важнее всего: потерянное число — не вопрос стиля.
Ярус 2: суждение LLM, на том, что пометил первый. GEMBA-MQM по сегментам, которым дешёвый ярус поставил ниже порога.
Арифметика и есть весь аргумент. Если первый ярус пропускает 90% сегментов, вы платите за LLM-суждение на 10% объёма. Правилен ли этот порог — эмпирический вопрос про ваш контент, и это самый значимый параметр во всей схеме.
Отказ, из-за которого оценка выглядит работающей
Теперь то, ради чего стоит читать.
Наш ярус GEMBA-MQM звал модель с бюджетом max(4096, n * 150) — то есть ровно 4096 для любого пакета меньше 27 сегментов, а это большинство пакетов. Провайдер перешёл на рассуждающую модель. Рассуждающая модель тратит на размышление тот же бюджет, что на ответ, — и ответ вернулся с finish_reason=length, completion=4096, reasoning=4096 и без содержимого вовсе.
Пустой ответ уходил в фолбэк, возвращающий ровные 75 баллов с пометкой estimator="fallback".
То есть оценка качества возвращала 75. Всегда. Месяцами. Ничто не падало, ничто не алертило, а число было достаточно правдоподобным, чтобы никто не посмотрел: 75 из 100 — ровно то, чего от системы оценки и ждут.
База рассказала всё, как только мы её спросили: 1581 сегмент с оценкой rule_based, 70 с gemba-mqm, 6 с fallback. LLM-ярус практически перестал работать, и форма этих счётчиков была единственной уликой.
После починки — один флаг, велящий модели не думать, — на 14 машинно переведённых сегментах живой выписки ЕГРН:
| До | После | |
|---|---|---|
| Ответ провайдера | пустой, finish_reason=length | JSON с разбором ошибок |
| Оценщик | fallback | gemba-mqm |
| Оценки | ровные 75 у всех | 100 у тринадцати, 96 у одного |
| Найдено ошибок MQM | 0 | 1 настоящая — style/awkward на формулировке срока кредита |
| Время | — | 6,1 с на 14 сегментов |
Два урока, и второй — общий.
Фолбэк, возвращающий правдоподобное значение, хуже фолбэка, который падает. Если ваш ярус оценки не может работать, вы хотите об этом знать. Число, означающее «мы это не измеряли», не должно быть по форме таким же, как число, означающее «измеряли, и всё хорошо».
Помечайте каждую оценку тем оценщиком, который её выдал. Это единственное поле превратило невидимую аварию в пятиминутную диагностику.
Что тот же замер сказал про дешёвый ярус
Побочная находка, и полезная. Правиловый ярус оценил те же 14 сегментов в 75–85 и не пропустил к LLM ни одного.
А LLM поставил тринадцати из них 100.
То есть префильтр консервативен, а не ошибочен: он занижает хорошие переводы, но не пропускает плохие. Ничего дефектного не отгружалось. Но два следствия всё же были: пользователи видели пессимистичные баллы на хорошей работе, а дорогой ярус не получал слова — благодаря чему описанная выше авария и оставалась скрытой.
Калибровка префильтра — не про точность вообще. Она про две асимметричные цены: ложное «плохо» тратит вызов LLM и занижает показанный балл, ложное «хорошо» отгружает дефект. Ставьте порог, держа обе перед глазами, и мерьте, какая доля эскалируется. Если не эскалируется ничего — ваш второй ярус декоративен.
Что мерить, если начинаете
- Долю эскалации. Какая часть сегментов доходит до дорогого яруса? Если 0% или 100% — порог ничего не делает.
- Распределение по оценщикам. Сколько оценок пришло от каждого яруса, включая фолбэки. Это та проверка здоровья, которая поймала бы нашу аварию в первый день.
- Согласие на помеченном множестве. Из сегментов, которым LLM-ярус ставит плохо, со сколькими согласен человек? Единственное число, говорящее, что ярус окупает себя.
- Числа отдельно. Числовая целостность — не оценка качества. Проверяйте её детерминированно и показывайте отдельно: перевод может получить 100 и потерять код ТН ВЭД.
Главное
- Настоящее преимущество GEMBA-MQM — проверяемость, а не корреляция: список ошибок с категориями и фрагментами — то, с чем ревьюер может работать.
- GEMBA V2 покупает снижение дисперсии примерно за 10× цены. Применяйте на помеченных сегментах, а не как ярус по умолчанию.
- MetricX-25 точнее и требует своей инфраструктуры — реальный размен, если вы только на API.
- Фолбэк с правдоподобным баллом прячет аварию. Наш возвращал ровные 75 месяцами; выдала его пометка оценщика.
- Префильтр, не эскалирующий ничего, делает дорогой ярус декоративным. Мерьте долю эскалации и ставьте порог против асимметричных цен.
FAQ
Что такое оценка качества без эталона?
Оценка перевода по одним лишь исходнику и переводу, без человеческого эталона для сравнения. Это единственный вид измерения, доступный в проде, где эталонов не существует по определению.
GEMBA-MQM всё ещё верный выбор в 2026?
Для команд на платных API — да: она воспроизводима без хостинга чего-либо, а её вывод — проверяемый список ошибок, а не голый балл. MetricX-25 лучше на бенчмарках, но требует эксплуатировать модель, а это обязательство другого рода.
Что меняет GEMBA V2?
Сохраняет промптинг и снижает дисперсию, сэмплируя суждение примерно десять раз и агрегируя ранговым взвешенным средним вместо обычного. Цена растёт вместе с сэмплированием, поэтому применять её лучше выборочно — к сегментам, уже помеченным дешёвым ярусом.
Почему оценка качества может возвращать одинаковый балл на всё?
Потому что вызов LLM возвращает пустоту, а пробел закрывает фолбэк. У нас рассуждающая модель потратила весь бюджет токенов на размышление, а фолбэк вернул ровные 75, выглядевшие настоящим баллом. Починка — один флаг; урок — фолбэк обязан отличаться от измерения.
Должна ли оценка качества покрывать точность чисел?
Нет — проверяйте числа детерминированно и показывайте отдельно. Сегмент может получить 100 по качеству и всё равно потерять код ТН ВЭД: пропавшая цифра не проблема беглости, и ни одна метрика качества не устроена так, чтобы её заметить.
Заключение
Оценка без эталона стала достаточно хороша, чтобы интересные вопросы сместились из методологии в эксплуатацию: какой ярус работает на каких сегментах, чем помечен балл и было ли вообще измерено то число, на которое вы смотрите.
Методологическая литература продолжит улучшать корреляцию. По нашему опыту выигрыши покрупнее лежали в другом месте: заметить, что дорогой ярус тихо перестал работать, и обнаружить, что дешёвый до него ничего и не допускал.
Если хотите перевод документов с оценкой качества, которую можно рассмотреть посегментно, — попробуйте KTTC.
