Skip to main content
Назад к глоссарию
Термин глоссария

QE (оценка качества перевода)

Аббревиатура: QE

QE (Quality Estimation) — общее название для автоматической оценки качества перевода моделью, включая оценку с эталонным переводом и без него.

3 мин чтения
quality-assessmentавтоматическая оценкамашинный перевод

Что такое QE?

QE (Quality Estimation) — зонтичный термин для любой автоматической оценки качества перевода, выполняемой моделью, а не человеком. Под QE попадают и классические метрики с эталоном вроде BLEU, и безэталонные подходы вроде MTQE, и оценка через LLM-судью (GEMBA, LLM-as-a-judge).

Если LQA — это проверка человеком, то QE — её автоматизированный аналог: быстрее, дешевле, но менее чувствителен к тонким смысловым и культурным нюансам.

Два поколения QE

С эталоном

Первое поколение метрик — BLEU, а позже более совершенные chrF и TER — сравнивают машинный перевод с одним или несколькими эталонными переводами, написанными человеком. Совпадение слов и словосочетаний с эталоном превращается в число.

Без эталона

Второе поколение — COMET в reference-free режиме и подходы на базе LLM — не требует эталона вообще. Модель обучена предсказывать, как оценил бы перевод человек, глядя только на пару «исходник — перевод».

Индустрия к 2026 году в основном перешла на второе поколение: держать эталонные переводы для каждого нового документа непрактично, а качество безэталонных моделей вплотную приблизилось к эталонным метрикам на распространённых языковых парах.

Зачем нужен QE, если есть LQA

QE не заменяет проверку человеком там, где цена ошибки высока, — он решает другую задачу: с каким объёмом контента человек вообще может справиться. Компания, переводящая миллионы строк пользовательского контента в день, физически не может пропустить всё через LQA. QE позволяет:

  • Расставить приоритеты — направить редакторов на сегменты с низкой оценкой
  • Автоматически принять — пропустить сегменты с высокой уверенностью там, где риск это позволяет
  • Мониторить систему в целом — заметить деградацию качества движка перевода по статистике, а не по жалобам клиентов

QE-стек 2026 года

Актуальный подход в отрасли — не одна метрика, а комбинация: COMET даёт быстрый общий балл, а LLM-судья по рубрике оценивает то, что COMET не различает по отдельности, — адекватность, беглость, передачу идиом, культурный регистр, согласованность терминологии. Ни один автоматический метод не заменяет MQM-совместимую проверку человеком там, где ошибка стоит дорого.

Ограничения любого QE

Все методы QE, включая самые современные, обучены приближать усреднённое человеческое суждение — они статистические по своей природе. Модель может дать высокую оценку тексту с фактической ошибкой, если стилистически он похож на хорошие переводы из обучающей выборки, и заниженную — нестандартному, но верному переводу. QE — инструмент сортировки потока, а не окончательный вердикт для текста, где цена ошибки высока.

FAQ

QE и MTQE — это одно и то же?

Нет: QE — общий термин для любой автоматической оценки, MTQE — конкретно её безэталонный подвид. На практике их часто путают, потому что современные пайплайны почти всегда работают без эталона.

Можно ли полностью заменить человека на QE?

Для низкорискового контента — да, для юридических, медицинских и маркетинговых текстов QE используют как фильтр перед человеком, а не вместо него.

Какая метрика QE считается лучшей в 2026 году?

Единой «лучшей» метрики нет — актуальный подход комбинирует COMET с LLM-судьёй по рубрике, а не полагается на одну модель.

Как QE соотносится с ISO 5060?

ISO 5060 описывает процесс оценки качества перевода в целом и не привязан к конкретному инструменту; QE — один из способов выполнить часть этого процесса автоматически.

Нужен ли QE небольшой переводческой команде?

Да, если объём контента растёт быстрее штата редакторов — QE помогает решить, куда в первую очередь направить ограниченное время человека.

Связанные термины

Часто задаваемые вопросы

QE и MTQE — это одно и то же?

Нет: QE — общий термин для любой автоматической оценки, MTQE — конкретно её безэталонный подвид. На практике их часто путают, потому что современные пайплайны почти всегда работают без эталона.

Можно ли полностью заменить человека на QE?

Для низкорискового контента — да, для юридических, медицинских и маркетинговых текстов QE используют как фильтр перед человеком, а не вместо него.

Какая метрика QE считается лучшей в 2026 году?

Единой «лучшей» метрики нет — актуальный подход комбинирует COMET с LLM-судьёй по рубрике, а не полагается на одну модель.

Как QE соотносится с ISO 5060?

**[ISO 5060](/glossary/iso-5060)** описывает процесс оценки качества перевода в целом и не привязан к конкретному инструменту; QE — один из способов выполнить часть этого процесса автоматически.

Нужен ли QE небольшой переводческой команде?

Да, если объём контента растёт быстрее штата редакторов — QE помогает решить, куда в первую очередь направить ограниченное время человека.

KTTC Team
3 мин чтения

We use cookies to improve your experience. Learn more in our Cookie Policy.