什么是TQA?
**TQA(Translation Quality Assessment,翻译质量评估)**是根据定义的质量标准系统性评估翻译的过程。它涉及识别、分类和测量翻译错误,以提供客观的质量分数和可操作的反馈。
现代TQA已从主观的审稿人意见演变为使用标准化框架(如MQM)的数据驱动评估,实现跨项目、语言和供应商的一致质量测量。
TQA vs QA
| 方面 | TQA | QA(质量保证) |
|---|---|---|
| 重点 | 质量评估 | 质量预防 |
| 时机 | 翻译后 | 整个过程 |
| 输出 | 质量分数、报告 | 流程改进 |
| 工具 | 评估框架 | 自动检查 |
最佳实践:两者结合使用——QA预防错误,TQA测量结果。
关键TQA框架
MQM(多维质量指标)
具有分层错误类别的行业标准框架:
主要类别:
- 准确性:意义传达错误
- 流畅性:语言质量问题
- 术语:术语使用问题
- 风格:风格不一致
- 设计:格式/布局问题
- 区域设置:本地化错误
DQF(动态质量框架)
TAUS开发的框架,关注:
- 内容类型特定评估
- 生产力-质量平衡
- 行业基准
错误类别
准确性错误
| 错误类型 | 描述 | 严重程度 |
|---|---|---|
| 误译 | 含义错误 | Major/Critical |
| 添加 | 添加了不必要的内容 | Minor/Major |
| 遗漏 | 内容缺失 | Major/Critical |
| 未翻译 | 保留源语言 | Major |
| 过度翻译 | 过度诠释 | Minor/Major |
| 翻译不足 | 诠释不充分 | Minor/Major |
流畅性错误
| 错误类型 | 描述 | 严重程度 |
|---|---|---|
| 语法 | 语法错误 | Minor/Major |
| 拼写 | 拼写错误 | Minor |
| 标点 | 标点问题 | Minor |
| 排版 | 打字错误、格式 | Minor |
| 连贯性 | 逻辑流程问题 | Major |
| 语域 | 语气不当 | Minor/Major |
术语错误
| 错误类型 | 描述 | 严重程度 |
|---|---|---|
| 错误术语 | 术语不正确 | Major |
| 不一致 | 同一术语翻译不同 | Minor/Major |
| 非标准 | 未使用批准的术语 | Minor |
TQA流程
1. 定义质量模型
项目:技术文档
质量模型:MQM完整版
严重程度权重:
- Critical:10分
- Major:5分
- Minor:1分
通过阈值:98.5%(每1000字最多1.5罚分)
2. 选择样本
| 方法 | 使用场景 |
|---|---|
| 随机抽样 | 大批量 |
| 全面审核 | 关键内容 |
| 基于风险 | 已知问题区域 |
| 统计 | 质量认证 |
3. 评估内容
对于每个识别的错误:
- 类别(准确性、流畅性等)
- 子类别(误译、语法等)
- 严重程度(Critical、Major、Minor)
- 备注(说明、更正)
4. 计算分数
质量分数 = 100 - (罚分 / 字数 × 1000)
示例:
- 审核5000字
- 错误:2 Critical (20分) + 5 Major (25分) + 10 Minor (10分) = 55分
- 分数:100 - (55/5000 × 1000) = 100 - 11 = 89%
5. 报告和行动
- 生成质量报告
- 识别错误模式
- 向翻译人员提供反馈
- 实施改进
TQA指标
质量分数计算
基于罚分的评分:
分数 = 100 - Σ(错误严重程度 × 错误数量) / 字数 × 乘数
常见阈值:
| 分数 | 质量级别 |
|---|---|
| 99%+ | 优秀 |
| 97-99% | 良好 |
| 95-97% | 可接受 |
| 93-95% | 需改进 |
| <93% | 不通过 |
自动化TQA
基于AI的质量评估
现代TQA工具使用AI进行:
- 自动错误检测:语法、拼写、术语
- 质量估算:预测性质量评分
- 一致性检查:跨文档验证
- 模式识别:识别系统性问题
人+AI方法
工作流程:
1. 自动QA检查 → 修复明显错误
2. AI质量估算 → 标记高风险片段
3. 人工TQA审核 → 评估样本
4. 反馈循环 → 改进AI模型
TQA最佳实践
对于评估人员
使用一致的标准
- 跨项目使用相同框架
- 明确的错误定义
- 记录的严重程度指南
保持客观
- 关注错误,而非偏好
- 区分关键问题和次要问题
- 提供建设性反馈
考虑上下文
- 内容类型很重要
- 目标受众期望
- 时间/预算限制
对于管理者
设定明确期望
- 预先定义质量级别
- 传达阈值
- 与业务目标一致
促进改进
- 与翻译人员分享反馈
- 跟踪质量趋势
- 奖励质量成就
常见问题
什么是好的TQA分数?
行业标准通常认为97%+是良好质量。关键内容(医疗、法律)通常需要99%+。适当的阈值取决于内容类型、风险级别和业务要求。
应该评估多少字?
样本量取决于项目规模和要求。常见方法:大项目10-20%,关键内容100%,或认证的统计抽样。
TQA应该由翻译人员还是单独的审稿人进行?
理想情况下,由未翻译内容的合格审稿人进行。这保证了客观性。但是,翻译人员自查作为正式TQA前的第一步是有价值的。
如何处理TQA分歧?
校准会议有助于统一评估人员。对于具体争议:记录双方观点,必要时升级,并根据决定更新指南。
AI能取代人工TQA吗?
AI增强TQA,但不能替代人类对细微质量评估的判断。AI擅长一致性检查;人类对于评估意义、风格和文化适当性至关重要。
TQA应该多久进行一次?
每个项目都应包括TQA。项目内的频率取决于风险:高风险内容持续进行,常规工作抽样进行。
