Skip to main content

MQM в эпоху LLM: почему гладкие переводы всё ещё нуждаются в человеческой оценке качества

Алекс Чен16.03.20268 min read
mqmкачество-переводаоценка-llmcometстандарты-качества

Ловушка беглости

Большие языковые модели перевернули перевод. Их тексты грамматически безупречны, стилистически связны и звучат удивительно естественно. Вот только именно в этом и проблема.

Когда перевод прекрасно читается, но передаёт неверный смысл, автоматические метрики зачастую молчат. COMET выдаёт высокий балл. MetricX ничего не флагует. Ошибка попадает в продакшен — и дозировка лекарства искажена, юридическая оговорка перевёрнута, а характеристика продукта выдумана из воздуха.

Это и есть ловушка беглости: LLM оптимизируют то, как перевод звучит, а не то, что он означает. В 2026 году, когда организации прогоняют через LLM-конвейеры миллионы сегментов в месяц, разрыв между беглостью и точностью стал проблемой номер один.

MQM — Multidimensional Quality Metrics — появился задолго до господства LLM. Но его подход на основе таксономии ошибок актуален сейчас как никогда. Разберём почему.

Почему автоматические метрики не видят галлюцинации

Парадокс COMET

COMET (и безреференсный COMET-KIWI) — золотой стандарт автоматической оценки. Он хорошо коррелирует с человеческими суждениями — в среднем. Но средние значения скрывают именно те сбои, которые опаснее всего.

Пример:

Текст
Источник (DE):Die Dosierung beträgt 5 mg zweimal täglich.
Эталон:Дозировка составляет 5 мг два раза в день.
Выход LLM:Рекомендуемая дозировка составляет 5 мг три раза в день для оптимального эффекта.
COMET-балл:0,87 (Хороший)

Выход LLM беглый, регистр подходящий, даже добавлено правдоподобное уточнение. COMET ставит высокую оценку — эмбеддинг-сходство сильное. Но перевод фактически ошибочен: «два раза в день» превратилось в «три раза в день», а «рекомендуемая… для оптимального эффекта» — чистая выдумка.

Почему так происходит

Автоматические метрики обучались на человеческих оценках, где доминировал сигнал беглости. Когда переводы производили фразовые или ранние NMT-системы, беглость была главным дифференциатором: точные переводы часто звучали коряво. Метрики научились придавать беглости высокий вес.

LLM перевернули распределение. Почти все выходы LLM беглые. Дисперсия переместилась в область точности — а метрики за этим не поспели.

МетрикаПроблемы беглостиПроблемы точностиГаллюцинации
COMETОтличноУмеренноПлохо
MetricXОтличноУмеренноПлохо
COMET-KIWI (QE)ХорошоНизкоОчень плохо
COMETKiwi-XLХорошоУмеренноНизко
Человек + MQMОтличноОтличноОтлично

Типы галлюцинаций при переводе

Галлюцинации LLM при переводе распадаются на пять характерных категорий:

  1. Числовые искажения — изменение количеств, дат, процентов, дозировок
  2. Семантические добавления — вставка правдоподобной, но отсутствующей в оригинале информации
  3. Семантические пропуски — удаление клауз или уточнений, ограничивающих смысл
  4. Подмена сущностей — замена одной именованной сущности другой из той же категории
  5. Инверсия полярности — перевёрнутые отрицания или сравнения

Каждая из них может дать перевод с высоким автоматическим баллом — и существенной ошибкой внутри. Неприятное сочетание.

Таксономия ошибок MQM для LLM-переводов

MQM задаёт иерархическую таксономию ошибок. В эпоху LLM измерение точности требует повышенного внимания, а ошибки беглости стали сравнительно редкими — почти экзотикой.

Сдвиг распределения: NMT vs LLM

Категория ошибкиNMT (2020)LLM (2026)Изменение
Точность — Искажение смысла28%22%
Точность — Добавление3%18%↑↑↑
Точность — Пропуск15%12%
Беглость — Грамматика22%3%↓↓↓
Беглость — Регистр8%5%
Терминология18%25%
Стиль6%15%

Самый тревожный сдвиг — категория «Точность — Добавление»: LLM добавляют информацию, отсутствующую в исходном тексте, в 6 раз чаще, чем традиционные NMT. Это и есть галлюцинации — тот тип ошибок, который автоматические метрики ловят хуже всего.

Калибровка серьёзности для ревью LLM-переводов

При работе с MQM по выходам LLM важно правильно калибровать серьёзность:

СерьёзностьОпределениеШтрафПример
КритическаяИзменяет смысл в контексте безопасности/права/финансов25Дозировка «дважды» → «трижды»
СерьёзнаяНеверный смысл в менее рисковом контексте5Добавление необоснованного маркетингового утверждения
НезначительнаяТонкое отклонение, смысл сохранён1Лёгкое несоответствие регистра
НейтральнаяПредпочтение, не ошибка0Выбор синонима

Оценка рассчитывается так:

Балл = 100 - (Сумма штрафных баллов / Количество слов × 100)

Отраслевые пороги:

  • 95+: готово к публикации
  • 90–95: приемлемо с лёгкой вычиткой
  • 85–90: требуется постредактирование
  • <85: отклонить и переперевести

Человек + MQM + автометрики = полная картина

Ни один подход сам по себе не достаточен. Рабочий конвейер оценки сочетает оба.

Двухуровневая архитектура

Уровень 1: автоматический скрининг (100% сегментов)

COMET-KIWI на всех переведённых сегментах. Отлавливает грубые ошибки беглости, отфильтровывает очевидно плохие переводы. Быстро, дёшево, масштабируется.

Уровень 2: человеческая MQM-ревизия (10–20% сегментов)

Какие сегменты отправлять на ревью:

  • с COMET-баллами в неоднозначной зоне (0,80–0,90)
  • из высокорисковых доменов (медицина, право, финансы)
  • с высокой сложностью исходника (длинные предложения, вложенные списки, условные конструкции)
  • случайная выборка для калибровки

Двухуровневый подход выявляет 92–95% всех ошибок, требуя человеческого ревью лишь для малой доли объёма.

Сравнение стоимости

Для конвейера, обрабатывающего 1 миллион слов в месяц:

ПодходМесячная стоимостьДоля выявленных ошибокСроки
Только COMET$5065%Минуты
Только человеческий MQM$15 00098%5–7 дней
Гибрид (COMET + 15% MQM)$2 30094%1–2 дня

Гибрид обеспечивает обнаружение, близкое к человеческому, при стоимости на 85% ниже полного ревью.

Как KTTC реализует MQM-оценку

Платформа превращает описанную двухуровневую схему в рабочий процесс.

Аннотация на уровне сегментов

Ревьюеры работают в интерфейсе «бок о бок» — источник и перевод рядом. Они выделяют участки с ошибками прямо в тексте перевода и присваивают:

  1. Категорию ошибки из таксономии MQM (точность, беглость, терминология, стиль, локальные конвенции)
  2. Подкатегорию (например, точность → добавление, точность → пропуск)
  3. Серьёзность (критическая, серьёзная, незначительная)

Платформа автоматически рассчитывает MQM-баллы на уровне сегмента, документа и проекта.

Режим сравнения моделей

При оценке выходов разных LLM платформа показывает анонимизированные переводы бок о бок. Ревьюеры аннотируют каждую версию независимо — предвзятость по имени модели исключена. После аннотации платформа раскрывает авторство и агрегирует профили качества.

Для оптимизации маршрутизации это бесценно: со временем вы строите эмпирическую карту — какая модель лучше справляется с каким типом контента и языковой парой.

Автоматическая маркировка

Автоматический слой KTTC помечает сегменты для приоритетного ревью:

  • Числовые расхождения — числа в источнике и переводе сравниваются, несовпадения поднимают флаг
  • Аномалии длины — переводы, значительно длиннее ожидаемого, могут содержать добавления
  • Нарушения терминологии — сегменты с неутверждёнными терминами
  • Низкая уверенность — сегменты, где COMET-KIWI выдаёт балл ниже настраиваемого порога

Эти маркеры увеличивают «попадаемость» человеческого ревью в 3–4 раза по сравнению со случайной выборкой. Бюджет на оценку расходуется точнее.

Примеры оценки

Пример 1: галлюцинированное добавление (критическая)

Текст
Источник (FR):Le contrat prend effet le 1er mars 2026.
Эталон:Договор вступает в силу 1 марта 2026 года.
Выход LLM:Договор вступает в силу 1 марта 2026 года и действует в течение 12 месяцев.

MQM-аннотация:

  • Участок ошибки: «и действует в течение 12 месяцев»
  • Категория: точность → добавление
  • Серьёзность: критическая (юридический контекст, выдуманное условие договора)
  • Штраф: 25 баллов

COMET-балл для этого перевода — 0,91. Метрика видит беглое, грамотное предложение и ставит высокую оценку. Только человеческое ревью ловит галлюцинированную клаузу.

Пример 2: числовое искажение (критическая)

Текст
Источник (JA):投与量は1日2回、各10mgです。
Эталон:Дозировка составляет 10 мг два раза в день.
Выход LLM:Дозировка составляет 10 мг один раз в день.

MQM-аннотация:

  • Участок ошибки: «один раз в день»
  • Категория: точность → искажение смысла
  • Серьёзность: критическая (медицинская дозировка)
  • Штраф: 25 баллов

Пример 3: несоответствие регистра (незначительная)

Текст
Источник (DE):Bitte wenden Sie sich an unseren Kundendienst.
Эталон:Пожалуйста, обратитесь в нашу службу поддержки клиентов.
Выход LLM:Напиши нам в поддержку, если что!

MQM-аннотация:

  • Участок ошибки: «Напиши нам в поддержку, если что!»
  • Категория: беглость → регистр
  • Серьёзность: незначительная (неформальный тон для формального источника)
  • Штраф: 1 балл

Как выстроить MQM-практику

Шаг 1: определите приоритеты ошибок

Не все категории MQM одинаково важны для каждой организации. Производитель медицинских устройств придаёт максимальный вес ошибкам точности; игровая компания может приоритизировать стиль и локальные конвенции. Определите весовые коэффициенты серьёзности до начала ревью.

Шаг 2: калибруйте ревьюеров

Межаннотаторское согласие — фундамент надёжных MQM-баллов. Проведите калибровочные сессии: несколько ревьюеров аннотируют одни и те же 50–100 сегментов, затем обсуждают расхождения. Цель — каппа Коэна 0,7+ до того, как баллы пойдут в продакшен-решения. Без калибровки MQM превращается в дорогой генератор шума.

Шаг 3: интегрируйте с конвейером

MQM приносит максимум пользы, когда баллы подаются обратно в конвейер:

  • настройка правил маршрутизации в мультимодельной схеме
  • выявление систематических ошибок для prompt engineering
  • установка качественных гейтов (отклонение батчей с баллом ниже 90)
  • бенчмаркинг новых моделей перед развёртыванием

Шаг 4: отслеживайте тренды

Одна MQM-оценка — снимок. Настоящая ценность — в продольном отслеживании: растут ли ошибки точности после обновления модели? Деградирует ли конкретная языковая пара? Аналитический дашборд KTTC выявляет такие тренды автоматически.

Практические рекомендации

  1. Не полагайтесь только на COMET для оценки LLM-переводов. Метрика создавалась для пре-LLM-распределения ошибок и систематически недооценивает проблемы точности.
  2. Внедрите двухуровневую модель. Автоскрининг 100% сегментов, человеческий MQM на 10–20% с интеллектуальной выборкой.
  3. Приоритизируйте категории точности. Для LLM-переводов добавления и пропуски — самые рисковые категории. Дайте им соответствующий вес.
  4. Используйте MQM-данные для улучшения LLM. Паттерны ошибок из ревью можно применять для доработки промптов, корректировки глоссариев и переобучения классификаторов маршрутизации.
  5. Вложитесь в калибровку ревьюеров. Непоследовательные MQM-баллы хуже, чем никакие. Калибровка — не опция, а необходимость.

FAQ

MQM — слишком медленно и дорого для больших объёмов?

Нет, если внедрить его в составе гибридного конвейера. Никто не проводит MQM-ревью каждого сегмента. Двухуровневый подход (автоскрининг + выборочное ревью) держит стоимость на уровне $2–3 за тысячу слов, выявляя 94%+ ошибок. Платформы вроде KTTC делают процесс практичным, автоматизируя выборку, интерфейс аннотации и агрегацию баллов.

Можно ли заменить человека LLM-судьёй для MQM-оценки?

Подходы «LLM-как-судья» улучшаются, но остаются ненадёжными именно для тех ошибок, которые критичнее всего — галлюцинированных добавлений и тонких семантических искажений. Когда одна LLM оценивает перевод другой LLM, возникает общая слепая зона: обе модели могут счесть галлюцинированный контент правдоподобным. LLM — для предварительного скрининга. Людей — из контура не убирать.

Как MQM соотносится с COMET и MetricX?

Они не конкурируют, а дополняют друг друга. COMET и MetricX — автоматические метрики: быстрые, масштабируемые, полезные для скрининга. MQM — фреймворк человеческой аннотации: медленнее, дороже, но значительно точнее в обнаружении критических ошибок. Лучшие конвейеры используют и то, и другое: автометрики для широты охвата, MQM — для глубины.

Какой минимальный размер выборки нужен для надёжной оценки?

Для статистически значимой оценки одного документа или батча проверьте минимум 200–300 сегментов (или 2 000–3 000 слов). Для сравнения двух моделей удвойте — 300+ сегментов на модель, в идеале одни и те же исходные сегменты, переведённые обеими. Режим сравнения моделей в KTTC создан именно для этого.

We use cookies to improve your experience. Learn more in our Cookie Policy.