Пост-редактируйте те сегменты, которым это нужно, а не весь документ
Очевидный способ улучшить машинный перевод — прогнать его через модель ещё раз и попросить версию получше. Это одна строка кода, и ощущается как бесплатное качество.
Бесплатным оно не является, а свежие замеры говорят, что и качеством нередко тоже: сплошной второй проход LLM по всему документу стоит непропорционально больше, чем возвращает (arXiv:2601.19410). Разумная версия той же идеи — выборочная: править только те сегменты, которым оценка качества поставила низкий балл. Ниже — как выбирать порог, что мерить и какими двумя способами выборочный подход ломается на практике.
Почему сплошной проход разочаровывает
Три причины, и третья обычно удивляет.
Большинству сегментов это не нужно. В типичном документе бо́льшая часть машинно переведённых сегментов в порядке. Второй проход по ним — трата без возможного выигрыша.
Проход не безрисковый. Модель, которую попросили улучшить верный перевод, его изменит — потому что её об этом и попросили. Часть изменений нейтральна, часть хуже, а на официальных документах «иначе» само по себе цена: ревьюер, уже согласовавший формулировку, видит новую.
Он прячет, где проблемы. После сплошного переписывания нельзя сказать, какие сегменты были слабыми: изменились все. Вы уничтожили сигнал, по которому улучшали бы шаг выше — промпт, глоссарий, выбор модели.
Выборочное пост-редактирование избегает всех трёх и даёт побочный продукт ценой не меньше самих правок: список того, с чем ваш пайплайн не справляется.
Форма точечного пайплайна
Четыре стадии, и деньги стоит только третья:
- Перевести. Как обычно.
- Оценить качество посегментно. Сначала дешёвые эвристики, LLM-суждение — только по тому, что они пометили. (О двухъярусной схеме мы писали отдельно; здесь работает та же конструкция.)
- Пост-редактировать сегменты ниже порога. С исходником, текущим переводом и — вот это важно — конкретной претензией от оценщика.
- Переоценить только отредактированные, чтобы понять, помогла ли правка.
Проектное решение живёт в третьей стадии. Передача редактору причины, по которой сегмент помечен, и отличает точечное пост-редактирование от дорогого сервиса перефразирования. «Это машинный перевод, улучши» даёт переписывание. «Термин глоссария для этого понятия — X, а в переводе Y» даёт исправление.
Как ставить порог
Порог — не вопрос качества, а вопрос асимметрии цен. Выпишите два числа до того, как выберете:
- Цена ложной пометки. Один лишний вызов редактора плюс риск, что верный сегмент изменят к худшему.
- Цена пропущенной. Дефект уезжает к заказчику. На таможенной декларации или свидетельстве это документ, который получатель отклонит.
Для официальных документов вторая цена доминирует с большим отрывом — а значит, порог должен быть щедрым: помечать больше, править больше, мириться с тратой. Для массового маркетингового контента баланс обратный.
Дальше измерьте то, на что большинство команд не смотрит: долю эскалации. Какая часть сегментов переходит порог?
Если ответ 0%, второй ярус декоративен, и вы платите за оценщика, который ничего не меняет. Если ответ близок к 100%, вы заново изобрели сплошной проход, только с лишними шагами.
Мы наступили на первое. Наш правиловый префильтр оценил пачку живых машинно переведённых сегментов в 75–85 и не эскалировал ни одного. LLM-ярус, когда мы заставили его посмотреть, поставил тринадцати из тех четырнадцати сегментов 100. Префильтр был консервативен, а не ошибочен — занижал хорошее и не пропускал плохого, — но практический эффект: дорогой ярус, который никогда не работал, и пользователи, видящие пессимистичные числа на верных переводах.
Вот этот отказ и стоит караулить: порог, который одновременно безопасен и инертен.
Что мерить, по порядку
1. Долю эскалации. По типам документов, а не в целом. Декларации и свидетельства ведут себя по-разному.
2. Приживаемость правок. Из отредактированных сегментов — сколько правка действительно улучшила? Переоценка только отредактированных даёт это почти даром. Если число низкое, проблема в промпте редактора, а не в пороге.
3. Согласие человека на помеченном множестве. Возьмите выборку помеченных сегментов к ревьюеру. Если он не согласен с большинством пометок, оценщик разкалиброван, и никакой порог его не спасёт.
4. На чём кластеризуются пометки. Это тот самый побочный продукт, и со временем он самый ценный выход. Если 60% пометок — расхождения с глоссарием, лечение не в дополнительном пост-редактировании, а в том, чтобы положить глоссарий в первый промпт.
Два способа сломать выборочный подход
Редактор без причины. Если на третью стадию приходит только «этот сегмент получил мало», она перепишет, а не починит. Пробрасывайте конкретную претензию оценщика. Заодно это и объясняет, почему проверяемый оценщик — выдающий категории и фрагменты ошибок, а не голое число — стоит дороже чуть лучше коррелирующего.
Порог, который уплывает. Смените модель, промпт или глоссарий — и распределение баллов уедет у вас под ногами. Порог, выставленный под прошлоквартальное распределение, может тихо стать инертным, а выглядит это в точности как «качество улучшилось». Перепроверяйте долю эскалации при любой смене компонента выше по течению и алертите, когда она уходит в ноль.
Где пост-редактирование — вообще не тот инструмент
Для официальных документов часть дефектов не должна доходить до пост-редактора:
- Пропавшие числа. Сверяйте цепочки цифр детерминированно. Сравнение стоит нисколько и не имеет мнений.
- Непереведённые подписи. Пройдитесь по переводу в поисках символов исходного письма. Тоже бесплатно.
- Расхождения с глоссарием. Проверяйте термины напрямую, а не спрашивайте модель, кажется ли ей терминология уместной.
Каждая из этих проверок дешевле, надёжнее и объяснимее как детерминированная, чем как проход LLM. Оставьте пост-редактированию то, что действительно требует суждения: неуклюжие формулировки, регистр, двусмысленность, которую первый проход разрешил неудачно.
Общий принцип: не тратьте вызов модели на вопрос, на который отвечает сравнение.
Главное
- Сплошной второй проход стоит непропорционально больше, чем возвращает, рискует изменить верные сегменты и уничтожает сигнал о том, где пайплайн слаб.
- Давайте редактору причину, а не только балл. Без конкретной претензии третья стадия переписывает вместо того, чтобы чинить.
- Ставьте порог от асимметрии цен, а не от целевого качества: на официальных документах пропущенный дефект доминирует над потраченным вызовом.
- Мерьте долю эскалации по типам документов. Ноль — дорогой ярус декоративен; около 100% — вы пересобрали сплошной проход.
- Сначала детерминированные проверки. Числа, непереведённые подписи и термины глоссария — это сравнения, а не суждения, и вызова модели они потреблять не должны.
FAQ
Что такое точечное пост-редактирование?
Автоматический проход пост-редактирования только по тем сегментам, которые оценщик качества пометил как слабые, а не по всему документу. Он забирает большую часть пользы за долю цены и даёт побочным продуктом список того, где пайплайн буксует.
Как выбрать порог качества?
Из асимметрии между ложной пометкой (один потраченный вызов плюс риск изменить верный сегмент) и пропущенной (дефект уезжает). Для официальных документов вторая цена доминирует, поэтому щедрый порог уместен. Дальше проверяйте, какая доля реально эскалируется.
Какой доли эскалации ждать?
Универсального числа нет, но 0% и почти 100% одинаково неверны. Ноль означает, что оценщик ничего не меняет и дорогой ярус декоративен; около 100% — что вы пересобрали сплошной проход с лишними шагами. Мерьте по типам документов.
Может ли пост-редактирование починить пропавшие числа?
Может, но не должно этим заниматься. Числовая целостность — детерминированное сравнение цепочек цифр между исходником и переводом: стоит нисколько, не способна выдумать и ловит тот класс дефектов, который на декларациях и свидетельствах важнее всего. Пост-редактирование — для вопросов суждения.
Что делать, если оценщик и ревьюеры расходятся?
Значит, оценщик разкалиброван, и порог этого не исправит. Возьмите выборку помеченных сегментов, отдайте ревьюеру и измерьте согласие прежде, чем настраивать что-либо ещё: порог поверх плохого сигнала просто выбирает другое подмножество шума.
Заключение
Выборочное пост-редактирование — более дешёвая архитектура, чем сплошной проход, но это не главное его преимущество. Главное в том, что оно вынуждает завести оценку качества, которой вы доверяете, — а как только она есть, список её пометок говорит, что чинить выше по течению.
Больше всех выигрывают команды, относящиеся к пометкам как к баг-репорту на собственный пайплайн, а не как к очереди задач. Отредактировать расхождение с глоссарием — починка одного сегмента. Положить глоссарий в промпт — починка всех.
Если хотите перевод документов, где оценка качества решает, что заслуживает второго взгляда, — попробуйте KTTC.
