Что такое сегмент?
Сегмент — это дискретная единица текста, которая обрабатывается как единая переводимая сущность в CAT-системах и системах памяти переводов. Сегментация — это процесс разделения исходного контента на такие управляемые единицы, которые затем становятся основой для перевода, хранения и повторного использования.
Наиболее распространённой границей сегмента является предложение, но сегментами могут быть также абзацы, заголовки, элементы списков или другие логические деления текста в зависимости от типа контента и применяемых правил сегментации.
Типы сегментации
Сегментация по предложениям
Наиболее распространённый подход, разбивающий текст по границам предложений.
Пример:
Исходный текст:
"Добро пожаловать на нашу платформу. Мы помогаем эффективно переводить контент."
Сегменты:
1. "Добро пожаловать на нашу платформу."
2. "Мы помогаем эффективно переводить контент."
Преимущества:
- Естественные единицы перевода
- Хороший leverage TM
- Отраслевой стандарт
Сложности:
- Аббревиатуры (г., т.д., и т.п.)
- Числа с точками (3.14)
- Многоточие (...)
- Специфика языка
Сегментация по абзацам
Каждый абзац становится одним сегментом.
Лучше для:
- Художественного перевода
- Маркетингового контента
- Контента, требующего сохранения потока
Недостатки:
- Ниже повторное использование TM
- Более крупные сегменты для управления
Пользовательская сегментация
На основе специфических правил или паттернов:
- По HTML-тегам
- По XML-элементам
- По переносам строк
- По пользовательским разделителям
Правила сегментации
Стандартные точки разрыва
| Паттерн | Действие | Пример |
|---|---|---|
| Точка + пробел | Разрыв | "Конец. Начало" → 2 сегмента |
| Вопросительный знак + пробел | Разрыв | "Почему? Потому" → 2 сегмента |
| Восклицательный знак + пробел | Разрыв | "Стоп! Продолжаем" → 2 сегмента |
| Двоеточие (контекстуально) | Иногда | Зависит от правил |
| Точка с запятой | Обычно нет | Остаётся в сегменте |
Обработка исключений
Аббревиатуры:
"Д-р Смит прибыл в 9 ч. утра."
→ Один сегмент (аббревиатуры не разрывают)
Числа:
"Результат составил 3,14159."
→ Один сегмент (десятичная точка не разрывает)
Сегментация в CAT-системах
SRX (Segmentation Rules eXchange)
Стандартный формат для определения правил сегментации:
<srx version="2.0">
<body>
<languagerules>
<languagerule languagerulename="Russian">
<rule break="no">
<beforebreak>\b(д-р|г-н|г-жа)\.</beforebreak>
<afterbreak>\s</afterbreak>
</rule>
<rule break="yes">
<beforebreak>[.?!]+</beforebreak>
<afterbreak>\s+[А-ЯЁ]</afterbreak>
</rule>
</languagerule>
</languagerules>
</body>
</srx>
Правила в разных инструментах
| CAT-система | Подход к сегментации |
|---|---|
| Trados | Встроенные + пользовательские SRX |
| memoQ | Редактор правил сегментации |
| Phrase | Конфигурация на уровне проекта |
| OmegaT | SRX-файлы |
Влияние на память переводов
Гранулярность сегментов vs повторное использование
| Гранулярность | Повторное использование TM | Сохранение контекста |
|---|---|---|
| Предложение | Высокое | Низкое |
| Абзац | Низкое | Высокое |
| Подпредложение | Очень высокое | Очень низкое |
Пример влияния
Сегментация по предложениям:
Запись TM: "Нажмите Сохранить для продолжения."
Новый текст: "Нажмите Сохранить для продолжения."
Совпадение: 100%
Сегментация по абзацам:
Запись TM: "Нажмите Сохранить для продолжения. Ваши изменения будут применены."
Новый текст: "Нажмите Сохранить для продолжения. Ваши настройки будут сохранены."
Совпадение: ~70%
Лучшие практики
Согласованная сегментация
Используйте одни правила во всём проекте
- Обеспечивает согласованность TM
- Позволяет точное сопоставление
Документируйте правила
- Делитесь с членами команды
- Включайте в настройку проекта
Учитывайте тип контента
- Технический: на уровне предложений
- Маркетинговый: может потребоваться абзац
- Программное обеспечение: построчно
Статус сегмента и рабочий процесс
Распространённые состояния сегментов
| Состояние | Значение |
|---|---|
| Новый | Ещё не переведён |
| Черновик | Перевод в процессе |
| Переведён | Перевод завершён |
| Проверен | Прошёл проверку |
| Подтверждён | Финальный, заблокирован |
| Отклонён | Требует переработки |
Пример рабочего процесса
Новый → Переведён → Проверен → Подтверждён
↓
Отклонён → Переведён (исправлен)
Функции на уровне сегмента
Свойства сегмента
- Исходный текст
- Целевой текст
- Процент совпадения
- Происхождение (TM, MT, человек)
- Статус
- Комментарии/заметки
- Метаданные (создан, изменён, кем)
Операции с сегментами
| Операция | Назначение |
|---|---|
| Разделить | Разделить на несколько сегментов |
| Объединить | Объединить несколько сегментов |
| Заблокировать | Предотвратить изменения |
| Скопировать источник | Заполнить цель источником |
| Вставить совпадение | Использовать предложение TM |
FAQ
Каков идеальный размер сегмента?
Уровень предложения — отраслевой стандарт для большинства типов контента. Он балансирует leverage TM с контекстом перевода. Однако маркетинговый или литературный контент может выиграть от уровня абзаца для лучшего потока.
Можно ли изменить сегментацию после начала перевода?
Да, но с осторожностью. Пересегментация может повлиять на совпадения TM и потребовать повторного перевода затронутых сегментов. Лучше определить правила сегментации до начала.
Почему разные CAT-системы по-разному сегментируют один текст?
Разные инструменты используют разные алгоритмы сегментации и правила по умолчанию. Даже со стандартами SRX реализации различаются. Всегда проверяйте сегментацию при смене инструментов.
Как сегменты связаны с памятью переводов?
Каждый подтверждённый сегмент становится записью TM (единицей перевода). Когда новый текст сегментируется так же, TM может найти совпадения. Согласованная сегментация критически важна для эффективности TM.
Что происходит с форматированием внутри сегментов?
Встроенные теги (жирный, курсив, ссылки) сохраняются внутри сегментов как плейсхолдеры или коды. Переводчики должны сохранять их в целевом тексте при переводе текста вокруг них.
Сегментировать по предложениям или абзацам для юридических документов?
Обычно на уровне предложений для договоров и юридического текста, так как это обеспечивает лучший leverage TM и точное сопоставление. Однако некоторые юридические пункты могут требовать сохранения вместе для контекста.
