LLM-as-judge(LLM 判分) 评测与工程
别名:
模型判分
用一个(通常更强、更便宜的)模型按 rubric 给输出打分,用于规则表达不了的维度。两条红线:rubric 必须可判;别用同一个模型又出题又判分。见[第 13 章](/chapters/13-eval-basics/)。
它是什么
LLM-as-judge(模型判分)是用一个(通常更强、更便宜的)模型按 rubric 给输出打分,用于规则表达不了的维度——「是否简洁」「是否让用户感到被尊重」这类主观判断,规则 grader 无从下手。rubric(评分细则)是核心:rubric 写得含糊,judge 就成了「凭感觉」的老好人。
两条红线
用 LLM-as-judge 有两条红线:rubric 必须可判(写「回答包含价格字段且为数字」,别写「回答看起来不错」);别用同一个模型又出题又判分(任务集和 grader 都是同一个模型写的,你测出来的很可能是「模型同意自己」,而不是「任务真的完成了」——这是它最经典的失效模式)。它的代价也在这里:不确定(同输入可能不同分)、更贵、需要与人工标定校准。MT-Bench 论文(Zheng et al., 2023)最早系统验证了强 LLM 作为 judge 与人类偏好的一致性,也指出了位置偏差、冗长偏好等陷阱。
在本教程的位置
第 13 章主线用规则 grader 走通全流程,LLM-as-judge 作为 grader 的一种实现——理解何时需要、代价几何即可。判断线只有一条:能用代码判的,永远先用代码(见 grader)。