MQM в эпоху LLM: почему гладкие переводы всё ещё нуждаются в человеческой оценке качества
Ловушка беглости
Большие языковые модели перевернули перевод. Их тексты грамматически безупречны, стилистически связны и звучат удивительно естественно. Вот только именно в этом и проблема.
Когда перевод прекрасно читается, но передаёт неверный смысл, автоматические метрики зачастую молчат. COMET выдаёт высокий балл. MetricX ничего не флагует. Ошибка попадает в продакшен — и дозировка лекарства искажена, юридическая оговорка перевёрнута, а характеристика продукта выдумана из воздуха.
Это и есть ловушка беглости: LLM оптимизируют то, как перевод звучит, а не то, что он означает. В 2026 году, когда организации прогоняют через LLM-конвейеры миллионы сегментов в месяц, разрыв между беглостью и точностью стал проблемой номер один.
MQM — Multidimensional Quality Metrics — появился задолго до господства LLM. Но его подход на основе таксономии ошибок актуален сейчас как никогда. Разберём почему.
Почему автоматические метрики не видят галлюцинации
Парадокс COMET
COMET (и безреференсный COMET-KIWI) — золотой стандарт автоматической оценки. Он хорошо коррелирует с человеческими суждениями — в среднем. Но средние значения скрывают именно те сбои, которые опаснее всего.
Пример:
| Текст | |
|---|---|
| Источник (DE): | Die Dosierung beträgt 5 mg zweimal täglich. |
| Эталон: | Дозировка составляет 5 мг два раза в день. |
| Выход LLM: | Рекомендуемая дозировка составляет 5 мг три раза в день для оптимального эффекта. |
| COMET-балл: | 0,87 (Хороший) |
Выход LLM беглый, регистр подходящий, даже добавлено правдоподобное уточнение. COMET ставит высокую оценку — эмбеддинг-сходство сильное. Но перевод фактически ошибочен: «два раза в день» превратилось в «три раза в день», а «рекомендуемая… для оптимального эффекта» — чистая выдумка.
Почему так происходит
Автоматические метрики обучались на человеческих оценках, где доминировал сигнал беглости. Когда переводы производили фразовые или ранние NMT-системы, беглость была главным дифференциатором: точные переводы часто звучали коряво. Метрики научились придавать беглости высокий вес.
LLM перевернули распределение. Почти все выходы LLM беглые. Дисперсия переместилась в область точности — а метрики за этим не поспели.
| Метрика | Проблемы беглости | Проблемы точности | Галлюцинации |
|---|---|---|---|
| COMET | Отлично | Умеренно | Плохо |
| MetricX | Отлично | Умеренно | Плохо |
| COMET-KIWI (QE) | Хорошо | Низко | Очень плохо |
| COMETKiwi-XL | Хорошо | Умеренно | Низко |
| Человек + MQM | Отлично | Отлично | Отлично |
Типы галлюцинаций при переводе
Галлюцинации LLM при переводе распадаются на пять характерных категорий:
- Числовые искажения — изменение количеств, дат, процентов, дозировок
- Семантические добавления — вставка правдоподобной, но отсутствующей в оригинале информации
- Семантические пропуски — удаление клауз или уточнений, ограничивающих смысл
- Подмена сущностей — замена одной именованной сущности другой из той же категории
- Инверсия полярности — перевёрнутые отрицания или сравнения
Каждая из них может дать перевод с высоким автоматическим баллом — и существенной ошибкой внутри. Неприятное сочетание.
Таксономия ошибок MQM для LLM-переводов
MQM задаёт иерархическую таксономию ошибок. В эпоху LLM измерение точности требует повышенного внимания, а ошибки беглости стали сравнительно редкими — почти экзотикой.
Сдвиг распределения: NMT vs LLM
| Категория ошибки | NMT (2020) | LLM (2026) | Изменение |
|---|---|---|---|
| Точность — Искажение смысла | 28% | 22% | ↓ |
| Точность — Добавление | 3% | 18% | ↑↑↑ |
| Точность — Пропуск | 15% | 12% | ↓ |
| Беглость — Грамматика | 22% | 3% | ↓↓↓ |
| Беглость — Регистр | 8% | 5% | ↓ |
| Терминология | 18% | 25% | ↑ |
| Стиль | 6% | 15% | ↑ |
Самый тревожный сдвиг — категория «Точность — Добавление»: LLM добавляют информацию, отсутствующую в исходном тексте, в 6 раз чаще, чем традиционные NMT. Это и есть галлюцинации — тот тип ошибок, который автоматические метрики ловят хуже всего.
Калибровка серьёзности для ревью LLM-переводов
При работе с MQM по выходам LLM важно правильно калибровать серьёзность:
| Серьёзность | Определение | Штраф | Пример |
|---|---|---|---|
| Критическая | Изменяет смысл в контексте безопасности/права/финансов | 25 | Дозировка «дважды» → «трижды» |
| Серьёзная | Неверный смысл в менее рисковом контексте | 5 | Добавление необоснованного маркетингового утверждения |
| Незначительная | Тонкое отклонение, смысл сохранён | 1 | Лёгкое несоответствие регистра |
| Нейтральная | Предпочтение, не ошибка | 0 | Выбор синонима |
Оценка рассчитывается так:
Балл = 100 - (Сумма штрафных баллов / Количество слов × 100)
Отраслевые пороги:
- 95+: готово к публикации
- 90–95: приемлемо с лёгкой вычиткой
- 85–90: требуется постредактирование
- <85: отклонить и переперевести
Человек + MQM + автометрики = полная картина
Ни один подход сам по себе не достаточен. Рабочий конвейер оценки сочетает оба.
Двухуровневая архитектура
Уровень 1: автоматический скрининг (100% сегментов)
COMET-KIWI на всех переведённых сегментах. Отлавливает грубые ошибки беглости, отфильтровывает очевидно плохие переводы. Быстро, дёшево, масштабируется.
Уровень 2: человеческая MQM-ревизия (10–20% сегментов)
Какие сегменты отправлять на ревью:
- с COMET-баллами в неоднозначной зоне (0,80–0,90)
- из высокорисковых доменов (медицина, право, финансы)
- с высокой сложностью исходника (длинные предложения, вложенные списки, условные конструкции)
- случайная выборка для калибровки
Двухуровневый подход выявляет 92–95% всех ошибок, требуя человеческого ревью лишь для малой доли объёма.
Сравнение стоимости
Для конвейера, обрабатывающего 1 миллион слов в месяц:
| Подход | Месячная стоимость | Доля выявленных ошибок | Сроки |
|---|---|---|---|
| Только COMET | $50 | 65% | Минуты |
| Только человеческий MQM | $15 000 | 98% | 5–7 дней |
| Гибрид (COMET + 15% MQM) | $2 300 | 94% | 1–2 дня |
Гибрид обеспечивает обнаружение, близкое к человеческому, при стоимости на 85% ниже полного ревью.
Как KTTC реализует MQM-оценку
Платформа превращает описанную двухуровневую схему в рабочий процесс.
Аннотация на уровне сегментов
Ревьюеры работают в интерфейсе «бок о бок» — источник и перевод рядом. Они выделяют участки с ошибками прямо в тексте перевода и присваивают:
- Категорию ошибки из таксономии MQM (точность, беглость, терминология, стиль, локальные конвенции)
- Подкатегорию (например, точность → добавление, точность → пропуск)
- Серьёзность (критическая, серьёзная, незначительная)
Платформа автоматически рассчитывает MQM-баллы на уровне сегмента, документа и проекта.
Режим сравнения моделей
При оценке выходов разных LLM платформа показывает анонимизированные переводы бок о бок. Ревьюеры аннотируют каждую версию независимо — предвзятость по имени модели исключена. После аннотации платформа раскрывает авторство и агрегирует профили качества.
Для оптимизации маршрутизации это бесценно: со временем вы строите эмпирическую карту — какая модель лучше справляется с каким типом контента и языковой парой.
Автоматическая маркировка
Автоматический слой KTTC помечает сегменты для приоритетного ревью:
- Числовые расхождения — числа в источнике и переводе сравниваются, несовпадения поднимают флаг
- Аномалии длины — переводы, значительно длиннее ожидаемого, могут содержать добавления
- Нарушения терминологии — сегменты с неутверждёнными терминами
- Низкая уверенность — сегменты, где COMET-KIWI выдаёт балл ниже настраиваемого порога
Эти маркеры увеличивают «попадаемость» человеческого ревью в 3–4 раза по сравнению со случайной выборкой. Бюджет на оценку расходуется точнее.
Примеры оценки
Пример 1: галлюцинированное добавление (критическая)
| Текст | |
|---|---|
| Источник (FR): | Le contrat prend effet le 1er mars 2026. |
| Эталон: | Договор вступает в силу 1 марта 2026 года. |
| Выход LLM: | Договор вступает в силу 1 марта 2026 года и действует в течение 12 месяцев. |
MQM-аннотация:
- Участок ошибки: «и действует в течение 12 месяцев»
- Категория: точность → добавление
- Серьёзность: критическая (юридический контекст, выдуманное условие договора)
- Штраф: 25 баллов
COMET-балл для этого перевода — 0,91. Метрика видит беглое, грамотное предложение и ставит высокую оценку. Только человеческое ревью ловит галлюцинированную клаузу.
Пример 2: числовое искажение (критическая)
| Текст | |
|---|---|
| Источник (JA): | 投与量は1日2回、各10mgです。 |
| Эталон: | Дозировка составляет 10 мг два раза в день. |
| Выход LLM: | Дозировка составляет 10 мг один раз в день. |
MQM-аннотация:
- Участок ошибки: «один раз в день»
- Категория: точность → искажение смысла
- Серьёзность: критическая (медицинская дозировка)
- Штраф: 25 баллов
Пример 3: несоответствие регистра (незначительная)
| Текст | |
|---|---|
| Источник (DE): | Bitte wenden Sie sich an unseren Kundendienst. |
| Эталон: | Пожалуйста, обратитесь в нашу службу поддержки клиентов. |
| Выход LLM: | Напиши нам в поддержку, если что! |
MQM-аннотация:
- Участок ошибки: «Напиши нам в поддержку, если что!»
- Категория: беглость → регистр
- Серьёзность: незначительная (неформальный тон для формального источника)
- Штраф: 1 балл
Как выстроить MQM-практику
Шаг 1: определите приоритеты ошибок
Не все категории MQM одинаково важны для каждой организации. Производитель медицинских устройств придаёт максимальный вес ошибкам точности; игровая компания может приоритизировать стиль и локальные конвенции. Определите весовые коэффициенты серьёзности до начала ревью.
Шаг 2: калибруйте ревьюеров
Межаннотаторское согласие — фундамент надёжных MQM-баллов. Проведите калибровочные сессии: несколько ревьюеров аннотируют одни и те же 50–100 сегментов, затем обсуждают расхождения. Цель — каппа Коэна 0,7+ до того, как баллы пойдут в продакшен-решения. Без калибровки MQM превращается в дорогой генератор шума.
Шаг 3: интегрируйте с конвейером
MQM приносит максимум пользы, когда баллы подаются обратно в конвейер:
- настройка правил маршрутизации в мультимодельной схеме
- выявление систематических ошибок для prompt engineering
- установка качественных гейтов (отклонение батчей с баллом ниже 90)
- бенчмаркинг новых моделей перед развёртыванием
Шаг 4: отслеживайте тренды
Одна MQM-оценка — снимок. Настоящая ценность — в продольном отслеживании: растут ли ошибки точности после обновления модели? Деградирует ли конкретная языковая пара? Аналитический дашборд KTTC выявляет такие тренды автоматически.
Практические рекомендации
- Не полагайтесь только на COMET для оценки LLM-переводов. Метрика создавалась для пре-LLM-распределения ошибок и систематически недооценивает проблемы точности.
- Внедрите двухуровневую модель. Автоскрининг 100% сегментов, человеческий MQM на 10–20% с интеллектуальной выборкой.
- Приоритизируйте категории точности. Для LLM-переводов добавления и пропуски — самые рисковые категории. Дайте им соответствующий вес.
- Используйте MQM-данные для улучшения LLM. Паттерны ошибок из ревью можно применять для доработки промптов, корректировки глоссариев и переобучения классификаторов маршрутизации.
- Вложитесь в калибровку ревьюеров. Непоследовательные MQM-баллы хуже, чем никакие. Калибровка — не опция, а необходимость.
FAQ
MQM — слишком медленно и дорого для больших объёмов?
Нет, если внедрить его в составе гибридного конвейера. Никто не проводит MQM-ревью каждого сегмента. Двухуровневый подход (автоскрининг + выборочное ревью) держит стоимость на уровне $2–3 за тысячу слов, выявляя 94%+ ошибок. Платформы вроде KTTC делают процесс практичным, автоматизируя выборку, интерфейс аннотации и агрегацию баллов.
Можно ли заменить человека LLM-судьёй для MQM-оценки?
Подходы «LLM-как-судья» улучшаются, но остаются ненадёжными именно для тех ошибок, которые критичнее всего — галлюцинированных добавлений и тонких семантических искажений. Когда одна LLM оценивает перевод другой LLM, возникает общая слепая зона: обе модели могут счесть галлюцинированный контент правдоподобным. LLM — для предварительного скрининга. Людей — из контура не убирать.
Как MQM соотносится с COMET и MetricX?
Они не конкурируют, а дополняют друг друга. COMET и MetricX — автоматические метрики: быстрые, масштабируемые, полезные для скрининга. MQM — фреймворк человеческой аннотации: медленнее, дороже, но значительно точнее в обнаружении критических ошибок. Лучшие конвейеры используют и то, и другое: автометрики для широты охвата, MQM — для глубины.
Какой минимальный размер выборки нужен для надёжной оценки?
Для статистически значимой оценки одного документа или батча проверьте минимум 200–300 сегментов (или 2 000–3 000 слов). Для сравнения двух моделей удвойте — 300+ сегментов на модель, в идеале одни и те же исходные сегменты, переведённые обеими. Режим сравнения моделей в KTTC создан именно для этого.
