Skip to main content
Назад к глоссарию
Термин глоссария

Сегмент (Единица перевода)

Дискретная единица текста, которая переводится как единое целое, обычно предложение или абзац, составляющая базовый элемент памяти переводов.

3 мин чтения
CAT-системыпамять переводовсегментациярабочий процесс

Что такое сегмент?

Сегмент — это дискретная единица текста, которая обрабатывается как единая переводимая сущность в CAT-системах и системах памяти переводов. Сегментация — это процесс разделения исходного контента на такие управляемые единицы, которые затем становятся основой для перевода, хранения и повторного использования.

Наиболее распространённой границей сегмента является предложение, но сегментами могут быть также абзацы, заголовки, элементы списков или другие логические деления текста в зависимости от типа контента и применяемых правил сегментации.

Типы сегментации

Сегментация по предложениям

Наиболее распространённый подход, разбивающий текст по границам предложений.

Пример:

Исходный текст:
"Добро пожаловать на нашу платформу. Мы помогаем эффективно переводить контент."

Сегменты:
1. "Добро пожаловать на нашу платформу."
2. "Мы помогаем эффективно переводить контент."

Преимущества:

  • Естественные единицы перевода
  • Хороший leverage TM
  • Отраслевой стандарт

Сложности:

  • Аббревиатуры (г., т.д., и т.п.)
  • Числа с точками (3.14)
  • Многоточие (...)
  • Специфика языка

Сегментация по абзацам

Каждый абзац становится одним сегментом.

Лучше для:

  • Художественного перевода
  • Маркетингового контента
  • Контента, требующего сохранения потока

Недостатки:

  • Ниже повторное использование TM
  • Более крупные сегменты для управления

Пользовательская сегментация

На основе специфических правил или паттернов:

  • По HTML-тегам
  • По XML-элементам
  • По переносам строк
  • По пользовательским разделителям

Правила сегментации

Стандартные точки разрыва

ПаттернДействиеПример
Точка + пробелРазрыв"Конец. Начало" → 2 сегмента
Вопросительный знак + пробелРазрыв"Почему? Потому" → 2 сегмента
Восклицательный знак + пробелРазрыв"Стоп! Продолжаем" → 2 сегмента
Двоеточие (контекстуально)ИногдаЗависит от правил
Точка с запятойОбычно нетОстаётся в сегменте

Обработка исключений

Аббревиатуры:

"Д-р Смит прибыл в 9 ч. утра."
→ Один сегмент (аббревиатуры не разрывают)

Числа:

"Результат составил 3,14159."
→ Один сегмент (десятичная точка не разрывает)

Сегментация в CAT-системах

SRX (Segmentation Rules eXchange)

Стандартный формат для определения правил сегментации:

<srx version="2.0">
  <body>
    <languagerules>
      <languagerule languagerulename="Russian">
        <rule break="no">
          <beforebreak>\b(д-р|г-н|г-жа)\.</beforebreak>
          <afterbreak>\s</afterbreak>
        </rule>
        <rule break="yes">
          <beforebreak>[.?!]+</beforebreak>
          <afterbreak>\s+[А-ЯЁ]</afterbreak>
        </rule>
      </languagerule>
    </languagerules>
  </body>
</srx>

Правила в разных инструментах

CAT-системаПодход к сегментации
TradosВстроенные + пользовательские SRX
memoQРедактор правил сегментации
PhraseКонфигурация на уровне проекта
OmegaTSRX-файлы

Влияние на память переводов

Гранулярность сегментов vs повторное использование

ГранулярностьПовторное использование TMСохранение контекста
ПредложениеВысокоеНизкое
АбзацНизкоеВысокое
ПодпредложениеОчень высокоеОчень низкое

Пример влияния

Сегментация по предложениям:

Запись TM: "Нажмите Сохранить для продолжения."
Новый текст: "Нажмите Сохранить для продолжения."
Совпадение: 100%

Сегментация по абзацам:

Запись TM: "Нажмите Сохранить для продолжения. Ваши изменения будут применены."
Новый текст: "Нажмите Сохранить для продолжения. Ваши настройки будут сохранены."
Совпадение: ~70%

Лучшие практики

Согласованная сегментация

  1. Используйте одни правила во всём проекте

    • Обеспечивает согласованность TM
    • Позволяет точное сопоставление
  2. Документируйте правила

    • Делитесь с членами команды
    • Включайте в настройку проекта
  3. Учитывайте тип контента

    • Технический: на уровне предложений
    • Маркетинговый: может потребоваться абзац
    • Программное обеспечение: построчно

Статус сегмента и рабочий процесс

Распространённые состояния сегментов

СостояниеЗначение
НовыйЕщё не переведён
ЧерновикПеревод в процессе
ПереведёнПеревод завершён
ПроверенПрошёл проверку
ПодтверждёнФинальный, заблокирован
ОтклонёнТребует переработки

Пример рабочего процесса

Новый → Переведён → Проверен → Подтверждён
            ↓
        Отклонён → Переведён (исправлен)

Функции на уровне сегмента

Свойства сегмента

  • Исходный текст
  • Целевой текст
  • Процент совпадения
  • Происхождение (TM, MT, человек)
  • Статус
  • Комментарии/заметки
  • Метаданные (создан, изменён, кем)

Операции с сегментами

ОперацияНазначение
РазделитьРазделить на несколько сегментов
ОбъединитьОбъединить несколько сегментов
ЗаблокироватьПредотвратить изменения
Скопировать источникЗаполнить цель источником
Вставить совпадениеИспользовать предложение TM

FAQ

Каков идеальный размер сегмента?

Уровень предложения — отраслевой стандарт для большинства типов контента. Он балансирует leverage TM с контекстом перевода. Однако маркетинговый или литературный контент может выиграть от уровня абзаца для лучшего потока.

Можно ли изменить сегментацию после начала перевода?

Да, но с осторожностью. Пересегментация может повлиять на совпадения TM и потребовать повторного перевода затронутых сегментов. Лучше определить правила сегментации до начала.

Почему разные CAT-системы по-разному сегментируют один текст?

Разные инструменты используют разные алгоритмы сегментации и правила по умолчанию. Даже со стандартами SRX реализации различаются. Всегда проверяйте сегментацию при смене инструментов.

Как сегменты связаны с памятью переводов?

Каждый подтверждённый сегмент становится записью TM (единицей перевода). Когда новый текст сегментируется так же, TM может найти совпадения. Согласованная сегментация критически важна для эффективности TM.

Что происходит с форматированием внутри сегментов?

Встроенные теги (жирный, курсив, ссылки) сохраняются внутри сегментов как плейсхолдеры или коды. Переводчики должны сохранять их в целевом тексте при переводе текста вокруг них.

Сегментировать по предложениям или абзацам для юридических документов?

Обычно на уровне предложений для договоров и юридического текста, так как это обеспечивает лучший leverage TM и точное сопоставление. Однако некоторые юридические пункты могут требовать сохранения вместе для контекста.

Связанные термины

Часто задаваемые вопросы

Каков идеальный размер сегмента?

Уровень предложения — отраслевой стандарт для большинства типов контента. Он балансирует leverage TM с контекстом перевода. Однако маркетинговый или литературный контент может выиграть от уровня абзаца для лучшего потока.

Можно ли изменить сегментацию после начала перевода?

Да, но с осторожностью. Пересегментация может повлиять на совпадения TM и потребовать повторного перевода затронутых сегментов. Лучше определить правила сегментации до начала.

Почему разные CAT-системы по-разному сегментируют один текст?

Разные инструменты используют разные алгоритмы сегментации и правила по умолчанию. Даже со стандартами SRX реализации различаются. Всегда проверяйте сегментацию при смене инструментов.

Как сегменты связаны с памятью переводов?

Каждый подтверждённый сегмент становится записью TM (единицей перевода). Когда новый текст сегментируется так же, TM может найти совпадения. Согласованная сегментация критически важна для эффективности TM.

Что происходит с форматированием внутри сегментов?

Встроенные теги (жирный, курсив, ссылки) сохраняются внутри сегментов как плейсхолдеры или коды. Переводчики должны сохранять их в целевом тексте при переводе текста вокруг них.

Сегментировать по предложениям или абзацам для юридических документов?

Обычно на уровне предложений для договоров и юридического текста, так как это обеспечивает лучший leverage TM и точное сопоставление. Однако некоторые юридические пункты могут требовать сохранения вместе для контекста.

Команда KTTC
Эксперты по технологиям перевода
3 мин чтения

We use cookies to improve your experience. Learn more in our Cookie Policy.