Skip to main content
返回术语表
术语

LLM-as-a-Judge(大模型充当评判者)

LLM-as-a-judge 是一种评估方法:让大语言模型依据文字写成的评分标准来评价他人的输出,而不是把它与参考答案作比较。

5 分钟阅读
质量评估自动化评估大语言模型

什么是 LLM-as-a-Judge?

LLM-as-a-judge 是一种评估方法:请一个大语言模型依据用普通语言写成的评分标准,去评价别人的输出——通常是另一个模型的输出,有时是人的译文。

这个转变说起来很短,后果却很大。传统指标把候选译文与参考答案作比较并计算重合度:BLEU 比对 n-gram,COMET 比对学习得到的向量表示。而评判模型根本拿不到参考答案。给它的是原文、译文,以及一段关于"在这里什么算好"的描述,然后请它把这段描述应用上去。

在翻译领域,这一方法最知名的实例是 GEMBA——一个具体的协议,要求模型按 MQM 类型学的错误类别标注问题,并为每处问题给出扣分。

这一方法为何流行

三个特性解释了它被广泛采用的原因,而每一个特性都带着自己的代价。

不需要参考译文。 正是"每份文件都要保存一份人工参考译文"这一要求,使得依赖参考的指标在研究之外难以落地。评判模型取消了这项要求——MTQE 这一类别存在的理由也在于此。

评分标准可以直接改写。 要改变评判者奖励什么,只需重写一段文字,而不必重新训练模型。一个团队若认为术语一致性比流畅度更重要,当天就能把这句话写进标准里。

输出的不只是分数,还有理由。 评判者能指出它反对的具体片段,以及反对的类别。这样的输出可以直接派给编辑处理,而 0.71 无处可派。

这一方法在哪里失效

失效是系统性的、有文献记载的,而且分布并不均匀——这正是危险之处。

位置偏好。 在比较两个候选时,评判模型偏向排在前面的那一个,比例明显高于随机水平。任何不交换顺序、不取平均的 A/B 评估,衡量的是呈现方式,而不是质量。

冗长偏好。 更长、更铺陈的答案,比同样正确却简洁的答案得分更高。在翻译中,这恰恰奖励了好译文所回避的东西:填充与解释性插入。

偏袒自己。 模型倾向于给自己产出的文本、以及同一家族模型产出的文本打出高于同等水平他方文本的分数。用同一家族的模型去评判一套系统,衡量的是亲缘关系,而不只是质量。

分数区间被压缩。 评判者的打分会聚集。要求 0–100 时,它们给出的大多在 70–95 之间,几乎没有更低的,于是"可接受"与"优秀"之间的区分被抹平,小幅退化淹没在噪声里。

把流畅当成准确。 一份流畅却含有事实错误的译文——数字写错、否定被反转、姓名被替换——在评判者读来像是好活儿,因为质量的表层信号一应俱全。对文件翻译而言这是最要命的失效:在那里,数字就是内容本身。

如何负责任地使用这一方法

评判者是一件分流工具。让它成为有用工具的做法:

  • 每次两两比较都交换顺序,并对两次结果取平均。
  • 尽可能用与生成方不同家族的模型来评判。
  • 依据带有明确类别的标准打分,而不是简单的"给这个打 1 到 10 分"——正是这些类别让分歧变得可以检查。
  • 在信任分数之前,先在样本上与人工判断做校准;提示词一改,就重新校准。
  • 绝不让评判者去把关人本可以抓住的问题。 数字、姓名、日期和具有法律意义的数量,需要的是确定性校验,而不是一个概率性的读者。

在 KTTC,GEMBA-MQM 质量评估在译后片段上运行(app/services/quality_estimation.py)。未被它评分的片段会自动放行而非判为不合格,因此高分记录的是"未被提出异议"——这与"已经过核验"并不是同一个说法。

常见问题

LLM-as-a-judge 和 GEMBA 是一回事吗?

不是。LLM-as-a-judge 是通用方法——模型依据标准评价输出。GEMBA 是建立在其上的一个具名协议,专用于翻译,要求评判者按 MQM 类别标注错误,而不是给出单一分数。

评判模型比 COMET 更好吗?

它们回答的是不同的问题。COMET 快速、便宜、稳定,返回一个数字;评判者较慢、要消耗一次模型调用,返回的是按类别拆分的理由。目前的实践是让 COMET 跑全量,再让评判者去看 COMET 标记出来的部分,而不是二选一。

评判模型能取代人工审校吗?

在错误代价高昂的地方不能。评判者近似的是一种平均化的人类阅读,而它已知的偏差都朝着自信而非谨慎的方向。它决定人的注意力投向何处,但不替代人。参见 LQA

与人工评分的一致性应该有多高?

这是一个应当自行测量、而不是引用的数值。一致性取决于评分标准、语言对、领域和模型,在一种场景下得到的数字,对另一种场景说明不了什么。

用同一个模型既翻译又评判,会让分数失效吗?

会让它产生偏差。偏袒自己是可测量的,安全的假设是:一套系统给自己的成果打分会打得宽松。如果有第二个模型家族可用,评判这一半应当交给它。

KTTC团队
5分钟阅读

We use cookies to improve your experience. Learn more in our Cookie Policy.