Skip to main content
Назад к глоссарию
Термин глоссария

Память переводов (Translation Memory)

Аббревиатура: TM

База данных, хранящая ранее переведённые сегменты для повторного использования, обеспечивая согласованность и снижая затраты на перевод.

5 мин чтения
технологии переводапродуктивностьбаза данныхлокализациясогласованность

Что такое память переводов?

Память переводов (TM, Translation Memory) — это технология баз данных, используемая в системах автоматизированного перевода (CAT), которая хранит сегменты исходного текста вместе с их переводами. Когда переводчик работает над новым контентом, TM автоматически находит идентичный или похожий текст, переведённый ранее, и предлагает существующий перевод для повторного использования.

Эта технология составляет основу современных переводческих процессов, позволяя организациям со временем накапливать ценные лингвистические активы, которые повышают эффективность, снижают затраты и обеспечивают согласованность.

Как работает память переводов

Сегментация

Первый шаг в работе TM — это сегментация, то есть разделение исходного контента на переводимые единицы. Обычно сегментами являются:

  • Предложения (наиболее часто)
  • Абзацы
  • Заголовки
  • Элементы списков
  • Ячейки таблиц

CAT-система использует правила сегментации на основе пунктуации, форматирования и языковых особенностей.

Структура хранения

Каждая запись TM (называемая единицей перевода или TU) содержит:

  • Исходный сегмент: Оригинальный текст на исходном языке
  • Целевой сегмент: Перевод на целевой язык
  • Метаданные: Дата создания, переводчик, проект, статус качества и т.д.
  • Контекст: Окружающий текст, информация о структуре документа

Типы совпадений

При анализе нового контента TM определяет разные уровни совпадений:

Тип совпаденияОписаниеТипичная скидка
100% совпадениеИдентичный сегмент70-90%
Контекстное совпадение (101%)100% + те же окружающие сегменты80-95%
Нечёткое совпадение (75-99%)Похожий, но не идентичный30-70%
Нет совпадения (0%)Похожий контент не найден0%

Типы памяти переводов

Файловая TM

Хранится как локальные файлы, обычно в формате TMX.

Преимущества:

  • Легко делиться и создавать резервные копии
  • Не требуется серверная инфраструктура
  • Работает офлайн

Ограничения:

  • Нет совместной работы в реальном времени
  • Сложности с контролем версий
  • Требуется ручная синхронизация

Серверная TM

Централизованная база данных, доступная нескольким пользователям.

Преимущества:

  • Обновления в реальном времени
  • Одновременный доступ
  • Централизованное управление
  • Лучший контроль безопасности

Ограничения:

  • Требуется серверная инфраструктура
  • Необходимо интернет-соединение
  • Более высокая сложность

Облачная TM

Размещается в облачной инфраструктуре.

Преимущества:

  • Не нужно управлять инфраструктурой
  • Автоматическое резервное копирование
  • Глобальная доступность
  • Масштабируемость

Ограничения:

  • Вопросы размещения данных
  • Постоянные расходы на подписку
  • Зависимость от провайдера

Leverage TM и ROI

Расчёт leverage TM

TM leverage измеряет процент нового контента, который совпадает с существующими переводами:

Leverage = (Совпавшие слова / Всего слов) × 100

Отраслевые показатели

Тип контентаТипичный leverageЭкономия затрат
Обновления ПО60-80%50-70%
Руководства к продуктам40-70%35-60%
Юридические договоры30-50%25-40%
Маркетинг10-30%10-25%
Техническая документация50-70%40-60%

Долгосрочная ценность

Ценность TM накапливается со временем:

  • Год 1: Создание актива (низкий leverage)
  • Год 2-3: Значительный leverage от предыдущей работы
  • Год 4+: Высокий leverage, существенная экономия

Хорошо поддерживаемая TM может снизить затраты на перевод на 40-60% для повторяющихся типов контента.

Лучшие практики для памяти переводов

Поддержание TM

  1. Регулярная очистка

    • Удаляйте дублирующиеся записи
    • Удаляйте устаревшие переводы
    • Исправляйте несоответствия
  2. Контроль качества

    • Проверяйте перед импортом внешней TM
    • Помечайте записи по уровню качества
    • Внедрите процессы утверждения
  3. Организация

    • Используйте описательные имена TM
    • Ведите отдельные TM по доменам/клиентам
    • Документируйте историю и источники TM

Стратегия сегментации

  • Используйте последовательные правила сегментации
  • Избегайте чрезмерной сегментации (теряется контекст)
  • Избегайте недостаточной сегментации (уменьшаются совпадения)
  • Учитывайте обработку аббревиатур

Интеграция TM

  • Связывайте TM с терминологическими базами
  • Внедрите поиск по конкордансу
  • Установите соответствующие штрафы для нечётких совпадений
  • Настройте автоматическое распространение

Память переводов vs машинный перевод

АспектПамять переводовМашинный перевод
ИсточникЧеловеческие переводыСгенерированные ИИ
КачествоПроверенное, согласованноеВарьируется
ОбучениеНа прошлой работеНа обучающих данных
Лучше дляПовторяющегося контентаНового контента
Модель затратСоздание активаЗа слово/API

Современный подход: Многие организации комбинируют оба метода:

  1. Сначала проверяют TM на существующие переводы
  2. Используют MT для сегментов без совпадений
  3. Человеческая проверка и постредактирование
  4. Утверждённые переводы возвращаются в TM

TMX: Стандартный формат

TMX (Translation Memory eXchange) — это стандартный формат ISO для обмена памятью переводов между разными CAT-системами.

Структура TMX

<tmx version="1.4">
  <header srclang="en" adminlang="en" datatype="plaintext"/>
  <body>
    <tu>
      <tuv xml:lang="en">
        <seg>Hello, world!</seg>
      </tuv>
      <tuv xml:lang="ru">
        <seg>Привет, мир!</seg>
      </tuv>
    </tu>
  </body>
</tmx>

Преимущества TMX

  • Универсальная совместимость
  • Сохраняет метаданные
  • Поддерживает несколько языков
  • Отраслевой стандарт

Продвинутые концепции TM

Контекстное сопоставление

Контекстное сопоставление учитывает не только сам сегмент, но и окружающий контент:

  • Предыдущий сегмент: Что было до
  • Следующий сегмент: Что будет после
  • Структура документа: Заголовки, форматирование

Это обеспечивает более точные совпадения для неоднозначных сегментов.

Штрафы TM

CAT-системы применяют штрафы для снижения оценки совпадений в определённых ситуациях:

  • Другой тип документа
  • Другой клиент/проект
  • Старая дата перевода
  • Несколько источников TM

Выравнивание TM

Создание TM из существующих переводов:

  1. Импортируйте исходный документ
  2. Импортируйте переведённый документ
  3. CAT-система автоматически выравнивает предложения
  4. Человеческая проверка и корректировка
  5. Импорт в TM

FAQ

Какого размера должна быть память переводов?

Идеального размера не существует — качество важнее количества. Хорошо поддерживаемая TM из 50 000 единиц перевода может быть ценнее, чем беспорядочная TM с 500 000 единиц. Сосредоточьтесь на релевантности и точности.

Можно ли обмениваться памятью переводов между разными CAT-системами?

Да, с использованием формата TMX (Translation Memory eXchange). TMX — это отраслевой стандарт, который позволяет обмениваться TM практически между всеми CAT-системами.

Как работают нечёткие совпадения?

Алгоритмы нечёткого сопоставления сравнивают сегменты с помощью таких методов, как расстояние Левенштейна, сопоставление токенов и анализ n-грамм. Нечёткое совпадение 75% означает, что примерно 75% контента идентичны, а 25% отличаются.

Использовать одну TM или несколько?

Это зависит от вашего рабочего процесса. Распространённые подходы:

  • Одна мастер-TM + проектные TM
  • Отдельные TM по доменам/клиентам
  • Многоуровневые TM (проверенные vs. непроверенные)

Как справляться с конфликтами TM?

Когда несколько TM содержат разные переводы для одного источника:

  • Приоритезируйте TM по надёжности
  • Используйте контекстное сопоставление
  • Внедрите процессы утверждения
  • Рассмотрите выбор на основе машинного обучения

В чём разница между TM и терминологической базой?

TM хранит переведённые сегменты (предложения), тогда как терминологическая база хранит отдельные термины с определениями и утверждёнными переводами. Обе работают вместе в CAT-системах для максимальной согласованности.

Связанные термины

Часто задаваемые вопросы

Какого размера должна быть память переводов?

Идеального размера не существует — качество важнее количества. Хорошо поддерживаемая TM из 50 000 единиц перевода может быть ценнее, чем беспорядочная TM с 500 000 единиц. Сосредоточьтесь на релевантности и точности.

Можно ли обмениваться памятью переводов между разными CAT-системами?

Да, с использованием формата TMX (Translation Memory eXchange). TMX — это отраслевой стандарт, который позволяет обмениваться TM практически между всеми CAT-системами.

Как работают нечёткие совпадения?

Алгоритмы нечёткого сопоставления сравнивают сегменты с помощью таких методов, как расстояние Левенштейна, сопоставление токенов и анализ n-грамм. Нечёткое совпадение 75% означает, что примерно 75% контента идентичны, а 25% отличаются.

Использовать одну TM или несколько?

Это зависит от вашего рабочего процесса. Распространённые подходы: - Одна мастер-TM + проектные TM - Отдельные TM по доменам/клиентам - Многоуровневые TM (проверенные vs. непроверенные)

Как справляться с конфликтами TM?

Когда несколько TM содержат разные переводы для одного источника: - Приоритезируйте TM по надёжности - Используйте контекстное сопоставление - Внедрите процессы утверждения - Рассмотрите выбор на основе машинного обучения

В чём разница между TM и терминологической базой?

TM хранит переведённые сегменты (предложения), тогда как терминологическая база хранит отдельные термины с определениями и утверждёнными переводами. Обе работают вместе в CAT-системах для максимальной согласованности.

Команда KTTC
Эксперты по технологиям перевода
5 мин чтения

We use cookies to improve your experience. Learn more in our Cookie Policy.