Skip to main content
返回术语表
术语

QE(翻译质量评估)

缩写: QE

QE(Quality Estimation)是模型自动评估翻译质量的统称,既包括依赖参考译文的方法,也包括无参考方法。

3 分钟阅读
质量评估自动化评估机器翻译

什么是QE?

QE(Quality Estimation)是泛指由模型(而非人)完成的任何自动化翻译质量评分的统称。它既包括BLEU这样的经典参考型指标,也包括MTQE这样的无参考方法,还包括LLM评判打分(GEMBALLM-as-a-judge)。

如果说**LQA**是人工审核,那QE就是它的自动化对应物:更快、更便宜,但对细微的语义与文化差别不够敏感。

QE的两代方法

依赖参考译文

第一代指标——BLEU,以及后来更精细的chrF和TER——将机器译文与一份或多份人工撰写的参考译文进行比对。与参考译文重合的词语和短语被换算成一个数字。

无需参考译文

第二代——无参考模式下的**COMET**以及基于LLM的方法——完全不需要参考译文。模型经过训练,仅凭「原文—译文」这一对文本就能预测人类会给出的评分。

到2026年,业界已基本转向第二代方法:为每一份新文档都准备参考译文并不现实,而无参考模型在常见语言对上的质量已非常接近参考型指标。

有了LQA,为什么还需要QE

QE并不是在错误代价高昂的场景下取代人工审核——它解决的是另一个问题:人力实际能处理多大的内容量。一家每天翻译数百万行用户内容的公司,不可能把全部内容都送去做LQA。QE可以帮团队:

  • 划定优先级——把低分句段优先交给编辑
  • 自动通过——在风险可控的情况下跳过高置信度句段
  • 监控系统整体状况——通过统计数据而非客户投诉,及早发现某个翻译引擎的质量下滑

2026年的QE技术栈

当前业界的做法不是依赖单一指标,而是组合使用:COMET给出快速的整体分数,LLM评判则按照评分标准评估COMET无法单独区分的维度——恰当性、流畅度、习语转换、文化语域、术语一致性。在错误代价高昂的场景下,没有任何自动化方法能替代与**MQM**兼容的人工审核。

任何QE方法都有局限

包括最先进的方法在内,所有QE方法本质上都是统计性的,训练目标是逼近平均化的人类判断。如果一段文本文风流畅、与训练数据中的优质译文相似,模型可能给带有事实错误的译文打高分;而对不落俗套但准确的译文,反而可能打低分。QE是筛选文本流的工具,不是对错误代价高昂的文本作出最终裁决。

常见问题

QE和MTQE是一回事吗?

不是:QE是任何自动化评分的统称,MTQE特指其中的无参考子类型。实践中两者常被混用,因为现代流程几乎总是运行在无参考模式下。

QE能完全取代人工吗?

对低风险内容可以。对法律、医疗和营销类文本,QE用作人工审核前的筛选工具,而不是替代品。

2026年哪种QE指标「最好」?

没有单一的「最佳」指标——当前的做法是将COMET与LLM评判评分标准结合,而非依赖单一模型。

QE与ISO 5060是什么关系?

**ISO 5060**描述的是翻译质量评估流程整体,并不绑定具体工具;QE是将这一流程的一部分自动化的方法之一。

小型翻译团队需要QE吗?

如果内容量的增长速度超过编辑团队的规模,就需要——QE能帮助团队决定优先把有限的人力投向哪里。

KTTC团队
3分钟阅读

We use cookies to improve your experience. Learn more in our Cookie Policy.