Что такое нечёткое совпадение?
Нечёткое совпадение (fuzzy match) возникает, когда память переводов (TM) содержит сегмент, похожий, но не идентичный переводимому исходному тексту. В отличие от 100%-го совпадения (точного совпадения), нечёткие совпадения требуют от переводчика проверки и адаптации предложенного перевода к новому контексту.
Процент нечёткого совпадения обычно варьируется от 50% до 99%, указывая на степень сходства сохранённого сегмента с текущим исходным текстом.
Уровни процентов совпадений
Типы совпадений
| Уровень | Описание | Действие переводчика |
|---|---|---|
| 100% (точное) | Идентичный исходный текст | Проверить, обычно принять |
| 101% (контекстное) | 100% + тот же окружающий текст | Наивысшая уверенность |
| 95-99% | Очень похоже, минимальные различия | Быстрое редактирование |
| 85-94% | Похоже, нужны некоторые изменения | Умеренное редактирование |
| 75-84% | Частично похоже | Значительное редактирование |
| 50-74% | Низкое сходство | Существенная правка или перевод заново |
| <50% | Минимальное сходство | Обычно не показывается |
Пример нечётких совпадений
Оригинальная запись TM (100%):
"Нажмите кнопку Сохранить, чтобы сохранить изменения."
Новый исходный текст vs совпадение TM:
| Новый текст | Совп. % | Различие |
|---|---|---|
| "Нажмите кнопку Сохранить, чтобы сохранить изменения." | 100% | Нет |
| "Нажмите кнопку Отправить, чтобы сохранить изменения." | 92% | Одно слово |
| "Нажмите кнопку Сохранить, чтобы применить изменения." | 88% | Одно слово |
| "Нажмите кнопку ОК, чтобы подтвердить изменения." | 78% | Два слова |
| "Выберите Сохранить для записи изменений." | 65% | Перестроено |
Как работает нечёткое сопоставление
Основы алгоритма
CAT-системы используют различные алгоритмы для расчёта сходства:
Расстояние Левенштейна
- Подсчитывает минимальные правки (вставки, удаления, замены)
- Сравнение на уровне символов или слов
Сопоставление на основе токенов
- Сравнивает отдельные слова/токены
- Учитывает порядок слов
Анализ N-грамм
- Сравнивает последовательности символов/слов
- Лучше для структурных изменений
Пример расчёта
Источник: "Сохраните документ перед закрытием"
TM: "Сохраните файл перед закрытием"
Совпадение токенов: 4/5 = 80%
С учётом важности слов: ~85%
Ценообразование нечётких совпадений
Стандартные отраслевые ставки
| Диапазон совпадений | Типичная скидка |
|---|---|
| 100% | 70-90% |
| 95-99% | 50-75% |
| 85-94% | 30-50% |
| 75-84% | 15-30% |
| 50-74% | 0-15% |
| Нет совпадения | Полная ставка |
Факторы ценообразования
- Более высокие совпадения = меньше усилий на редактирование
- Качество TM влияет на фактические усилия
- Сложность предметной области имеет значение
- Некоторые клиенты договариваются о других диапазонах
Работа с нечёткими совпадениями
Лучшие практики для переводчиков
Всегда проверяйте
- Никогда не принимайте нечёткие совпадения вслепую
- Проверяйте тонкие изменения смысла
- Верифицируйте согласованность терминологии
Эффективное редактирование
- Фокусируйтесь на подсвеченных различиях
- Используйте режимы сравнения в CAT-системе
- Используйте поиск по конкордансу
Распространённые ошибки
- Ложная уверенность в высоких процентах
- Упущение изменений контекста
- Пропуск различий в числах/датах
Штрафы за нечёткие совпадения
CAT-системы могут применять штрафы для снижения оценки совпадений:
Распространённые типы штрафов
| Тип штрафа | Назначение | Типичное снижение |
|---|---|---|
| Другая TM | Менее надёжный источник | -5 до -10% |
| Старый перевод | Устаревший контент | -5% |
| Другой проект | Несоответствие контекста | -3 до -5% |
| Другой тип файла | Проблемы формата | -2 до -5% |
| Машинное происхождение | Сгенерировано MT | -10 до -20% |
Пороги нечётких совпадений
Настройка минимальных порогов
| Настройка | Эффект |
|---|---|
| Минимум 70% | Показывает больше подсказок, больше шума |
| Минимум 75% | Сбалансировано, распространённое значение по умолчанию |
| Минимум 80% | Меньше, но более качественные совпадения |
| Минимум 85% | Консервативно, только полезные совпадения |
Влияние на продуктивность
Прирост продуктивности по уровню совпадений
| Уровень совпадения | Прирост слов/час |
|---|---|
| 100% | +300-400% |
| 95-99% | +200-300% |
| 85-94% | +100-150% |
| 75-84% | +50-75% |
| Нет совпадения | Базовый уровень |
FAQ
Какой процент нечёткого совпадения считается хорошим?
Совпадения выше 75% обычно полезны. Совпадения 85%+ дают значительные преимущества в продуктивности. Ниже 75% усилия на редактирование могут равняться или превышать перевод с нуля.
Следует ли принимать высокие нечёткие совпадения без проверки?
Нет. Даже совпадения 99% могут иметь критические различия — одно изменённое слово может полностью изменить смысл. Всегда проверяйте нечёткие совпадения, независимо от процента.
Как CAT-системы рассчитывают проценты нечётких совпадений?
Разные инструменты используют разные алгоритмы (расстояние Левенштейна, сопоставление токенов, n-граммы). Одна и та же пара сегментов может показывать разные проценты в разных инструментах. Фокусируйтесь на фактических различиях, а не только на числе.
Могут ли нечёткие совпадения привести к ошибкам?
Да. Распространённые проблемы:
- Принятие неподходящих совпадений
- Упущение тонких изменений смысла
- Распространение ошибок из оригинального перевода
- Несогласованная терминология
Как нечёткие совпадения влияют на наполнение памяти переводов?
Когда вы редактируете нечёткое совпадение и подтверждаете его, новый сегмент обычно добавляется в TM. Со временем это создаёт точные совпадения для контента, который ранее был только нечётким совпадением.
В чём разница между нечётким совпадением и машинным переводом?
Нечёткие совпадения получаются из человеческих переводов в вашей TM. Машинный перевод генерируется ИИ/алгоритмами. Нечёткие совпадения обычно надёжнее, но ограничены похожим ранее переведённым контентом.
