Skip to main content

Пост-редактируйте те сегменты, которым это нужно, а не весь документ

Мария Соколова10.11.20267 min read
постредактированиеmtpeоценка-качестваоптимизация-затратсравнения

Очевидный способ улучшить машинный перевод — прогнать его через модель ещё раз и попросить версию получше. Это одна строка кода, и ощущается как бесплатное качество.

Бесплатным оно не является, а свежие замеры говорят, что и качеством нередко тоже: сплошной второй проход LLM по всему документу стоит непропорционально больше, чем возвращает (arXiv:2601.19410). Разумная версия той же идеи — выборочная: править только те сегменты, которым оценка качества поставила низкий балл. Ниже — как выбирать порог, что мерить и какими двумя способами выборочный подход ломается на практике.

Почему сплошной проход разочаровывает

Три причины, и третья обычно удивляет.

Большинству сегментов это не нужно. В типичном документе бо́льшая часть машинно переведённых сегментов в порядке. Второй проход по ним — трата без возможного выигрыша.

Проход не безрисковый. Модель, которую попросили улучшить верный перевод, его изменит — потому что её об этом и попросили. Часть изменений нейтральна, часть хуже, а на официальных документах «иначе» само по себе цена: ревьюер, уже согласовавший формулировку, видит новую.

Он прячет, где проблемы. После сплошного переписывания нельзя сказать, какие сегменты были слабыми: изменились все. Вы уничтожили сигнал, по которому улучшали бы шаг выше — промпт, глоссарий, выбор модели.

Выборочное пост-редактирование избегает всех трёх и даёт побочный продукт ценой не меньше самих правок: список того, с чем ваш пайплайн не справляется.

Форма точечного пайплайна

Четыре стадии, и деньги стоит только третья:

  1. Перевести. Как обычно.
  2. Оценить качество посегментно. Сначала дешёвые эвристики, LLM-суждение — только по тому, что они пометили. (О двухъярусной схеме мы писали отдельно; здесь работает та же конструкция.)
  3. Пост-редактировать сегменты ниже порога. С исходником, текущим переводом и — вот это важно — конкретной претензией от оценщика.
  4. Переоценить только отредактированные, чтобы понять, помогла ли правка.

Проектное решение живёт в третьей стадии. Передача редактору причины, по которой сегмент помечен, и отличает точечное пост-редактирование от дорогого сервиса перефразирования. «Это машинный перевод, улучши» даёт переписывание. «Термин глоссария для этого понятия — X, а в переводе Y» даёт исправление.

Как ставить порог

Порог — не вопрос качества, а вопрос асимметрии цен. Выпишите два числа до того, как выберете:

  • Цена ложной пометки. Один лишний вызов редактора плюс риск, что верный сегмент изменят к худшему.
  • Цена пропущенной. Дефект уезжает к заказчику. На таможенной декларации или свидетельстве это документ, который получатель отклонит.

Для официальных документов вторая цена доминирует с большим отрывом — а значит, порог должен быть щедрым: помечать больше, править больше, мириться с тратой. Для массового маркетингового контента баланс обратный.

Дальше измерьте то, на что большинство команд не смотрит: долю эскалации. Какая часть сегментов переходит порог?

Если ответ 0%, второй ярус декоративен, и вы платите за оценщика, который ничего не меняет. Если ответ близок к 100%, вы заново изобрели сплошной проход, только с лишними шагами.

Мы наступили на первое. Наш правиловый префильтр оценил пачку живых машинно переведённых сегментов в 75–85 и не эскалировал ни одного. LLM-ярус, когда мы заставили его посмотреть, поставил тринадцати из тех четырнадцати сегментов 100. Префильтр был консервативен, а не ошибочен — занижал хорошее и не пропускал плохого, — но практический эффект: дорогой ярус, который никогда не работал, и пользователи, видящие пессимистичные числа на верных переводах.

Вот этот отказ и стоит караулить: порог, который одновременно безопасен и инертен.

Что мерить, по порядку

1. Долю эскалации. По типам документов, а не в целом. Декларации и свидетельства ведут себя по-разному.

2. Приживаемость правок. Из отредактированных сегментов — сколько правка действительно улучшила? Переоценка только отредактированных даёт это почти даром. Если число низкое, проблема в промпте редактора, а не в пороге.

3. Согласие человека на помеченном множестве. Возьмите выборку помеченных сегментов к ревьюеру. Если он не согласен с большинством пометок, оценщик разкалиброван, и никакой порог его не спасёт.

4. На чём кластеризуются пометки. Это тот самый побочный продукт, и со временем он самый ценный выход. Если 60% пометок — расхождения с глоссарием, лечение не в дополнительном пост-редактировании, а в том, чтобы положить глоссарий в первый промпт.

Два способа сломать выборочный подход

Редактор без причины. Если на третью стадию приходит только «этот сегмент получил мало», она перепишет, а не починит. Пробрасывайте конкретную претензию оценщика. Заодно это и объясняет, почему проверяемый оценщик — выдающий категории и фрагменты ошибок, а не голое число — стоит дороже чуть лучше коррелирующего.

Порог, который уплывает. Смените модель, промпт или глоссарий — и распределение баллов уедет у вас под ногами. Порог, выставленный под прошлоквартальное распределение, может тихо стать инертным, а выглядит это в точности как «качество улучшилось». Перепроверяйте долю эскалации при любой смене компонента выше по течению и алертите, когда она уходит в ноль.

Где пост-редактирование — вообще не тот инструмент

Для официальных документов часть дефектов не должна доходить до пост-редактора:

  • Пропавшие числа. Сверяйте цепочки цифр детерминированно. Сравнение стоит нисколько и не имеет мнений.
  • Непереведённые подписи. Пройдитесь по переводу в поисках символов исходного письма. Тоже бесплатно.
  • Расхождения с глоссарием. Проверяйте термины напрямую, а не спрашивайте модель, кажется ли ей терминология уместной.

Каждая из этих проверок дешевле, надёжнее и объяснимее как детерминированная, чем как проход LLM. Оставьте пост-редактированию то, что действительно требует суждения: неуклюжие формулировки, регистр, двусмысленность, которую первый проход разрешил неудачно.

Общий принцип: не тратьте вызов модели на вопрос, на который отвечает сравнение.

Главное

  • Сплошной второй проход стоит непропорционально больше, чем возвращает, рискует изменить верные сегменты и уничтожает сигнал о том, где пайплайн слаб.
  • Давайте редактору причину, а не только балл. Без конкретной претензии третья стадия переписывает вместо того, чтобы чинить.
  • Ставьте порог от асимметрии цен, а не от целевого качества: на официальных документах пропущенный дефект доминирует над потраченным вызовом.
  • Мерьте долю эскалации по типам документов. Ноль — дорогой ярус декоративен; около 100% — вы пересобрали сплошной проход.
  • Сначала детерминированные проверки. Числа, непереведённые подписи и термины глоссария — это сравнения, а не суждения, и вызова модели они потреблять не должны.

FAQ

Что такое точечное пост-редактирование?

Автоматический проход пост-редактирования только по тем сегментам, которые оценщик качества пометил как слабые, а не по всему документу. Он забирает большую часть пользы за долю цены и даёт побочным продуктом список того, где пайплайн буксует.

Как выбрать порог качества?

Из асимметрии между ложной пометкой (один потраченный вызов плюс риск изменить верный сегмент) и пропущенной (дефект уезжает). Для официальных документов вторая цена доминирует, поэтому щедрый порог уместен. Дальше проверяйте, какая доля реально эскалируется.

Какой доли эскалации ждать?

Универсального числа нет, но 0% и почти 100% одинаково неверны. Ноль означает, что оценщик ничего не меняет и дорогой ярус декоративен; около 100% — что вы пересобрали сплошной проход с лишними шагами. Мерьте по типам документов.

Может ли пост-редактирование починить пропавшие числа?

Может, но не должно этим заниматься. Числовая целостность — детерминированное сравнение цепочек цифр между исходником и переводом: стоит нисколько, не способна выдумать и ловит тот класс дефектов, который на декларациях и свидетельствах важнее всего. Пост-редактирование — для вопросов суждения.

Что делать, если оценщик и ревьюеры расходятся?

Значит, оценщик разкалиброван, и порог этого не исправит. Возьмите выборку помеченных сегментов, отдайте ревьюеру и измерьте согласие прежде, чем настраивать что-либо ещё: порог поверх плохого сигнала просто выбирает другое подмножество шума.

Заключение

Выборочное пост-редактирование — более дешёвая архитектура, чем сплошной проход, но это не главное его преимущество. Главное в том, что оно вынуждает завести оценку качества, которой вы доверяете, — а как только она есть, список её пометок говорит, что чинить выше по течению.

Больше всех выигрывают команды, относящиеся к пометкам как к баг-репорту на собственный пайплайн, а не как к очереди задач. Отредактировать расхождение с глоссарием — починка одного сегмента. Положить глоссарий в промпт — починка всех.

Если хотите перевод документов, где оценка качества решает, что заслуживает второго взгляда, — попробуйте KTTC.

We use cookies to improve your experience. Learn more in our Cookie Policy.