Что такое QE?
QE (Quality Estimation) — зонтичный термин для любой автоматической оценки качества перевода, выполняемой моделью, а не человеком. Под QE попадают и классические метрики с эталоном вроде BLEU, и безэталонные подходы вроде MTQE, и оценка через LLM-судью (GEMBA, LLM-as-a-judge).
Если LQA — это проверка человеком, то QE — её автоматизированный аналог: быстрее, дешевле, но менее чувствителен к тонким смысловым и культурным нюансам.
Два поколения QE
С эталоном
Первое поколение метрик — BLEU, а позже более совершенные chrF и TER — сравнивают машинный перевод с одним или несколькими эталонными переводами, написанными человеком. Совпадение слов и словосочетаний с эталоном превращается в число.
Без эталона
Второе поколение — COMET в reference-free режиме и подходы на базе LLM — не требует эталона вообще. Модель обучена предсказывать, как оценил бы перевод человек, глядя только на пару «исходник — перевод».
Индустрия к 2026 году в основном перешла на второе поколение: держать эталонные переводы для каждого нового документа непрактично, а качество безэталонных моделей вплотную приблизилось к эталонным метрикам на распространённых языковых парах.
Зачем нужен QE, если есть LQA
QE не заменяет проверку человеком там, где цена ошибки высока, — он решает другую задачу: с каким объёмом контента человек вообще может справиться. Компания, переводящая миллионы строк пользовательского контента в день, физически не может пропустить всё через LQA. QE позволяет:
- Расставить приоритеты — направить редакторов на сегменты с низкой оценкой
- Автоматически принять — пропустить сегменты с высокой уверенностью там, где риск это позволяет
- Мониторить систему в целом — заметить деградацию качества движка перевода по статистике, а не по жалобам клиентов
QE-стек 2026 года
Актуальный подход в отрасли — не одна метрика, а комбинация: COMET даёт быстрый общий балл, а LLM-судья по рубрике оценивает то, что COMET не различает по отдельности, — адекватность, беглость, передачу идиом, культурный регистр, согласованность терминологии. Ни один автоматический метод не заменяет MQM-совместимую проверку человеком там, где ошибка стоит дорого.
Ограничения любого QE
Все методы QE, включая самые современные, обучены приближать усреднённое человеческое суждение — они статистические по своей природе. Модель может дать высокую оценку тексту с фактической ошибкой, если стилистически он похож на хорошие переводы из обучающей выборки, и заниженную — нестандартному, но верному переводу. QE — инструмент сортировки потока, а не окончательный вердикт для текста, где цена ошибки высока.
FAQ
QE и MTQE — это одно и то же?
Нет: QE — общий термин для любой автоматической оценки, MTQE — конкретно её безэталонный подвид. На практике их часто путают, потому что современные пайплайны почти всегда работают без эталона.
Можно ли полностью заменить человека на QE?
Для низкорискового контента — да, для юридических, медицинских и маркетинговых текстов QE используют как фильтр перед человеком, а не вместо него.
Какая метрика QE считается лучшей в 2026 году?
Единой «лучшей» метрики нет — актуальный подход комбинирует COMET с LLM-судьёй по рубрике, а не полагается на одну модель.
Как QE соотносится с ISO 5060?
ISO 5060 описывает процесс оценки качества перевода в целом и не привязан к конкретному инструменту; QE — один из способов выполнить часть этого процесса автоматически.
Нужен ли QE небольшой переводческой команде?
Да, если объём контента растёт быстрее штата редакторов — QE помогает решить, куда в первую очередь направить ограниченное время человека.
