Grader(判分器) 评测与工程
别名:
判分器
给某方面表现打分的逻辑,可含多个断言。规则 grader 用代码断言(字符串匹配 / 工具调用 / 工具参数),快、确定、便宜但僵化;规则表达不了的维度才交给 LLM-as-judge。见[第 13 章](/chapters/13-eval-basics/)。
它是什么
Grader(判分器)是给某方面表现打分的逻辑,可含多个断言。规则 grader 是评估的默认选择:确定性代码、零成本、结果可复现。本章支持三种断言类型,恰好覆盖 Agent 行为的三个观察面:contains(最终回答包含文本)、tool_called(调用过某工具)、tool_args(工具带指定参数调用过)。
三个细节
写规则 grader 有三个值得注意的点:tool_args 只校验给出的键(断言「from=上海」时多传一个 date 不算错——检查的是「必须满足的条件」,不是「精确相等」);失败带原因(报告写「expected tool "list_attractions" to be called」而不是「任务失败」,原因本身就在指导修什么);判行为不判实现(不检查内部写法,只检查可观察地做了什么)。
局限与升级路径
规则 grader 的短板是僵化:抓不住「提到了拙政园但语气生硬」。规则表达不了的维度才上 LLM-as-judge——判断线只有一条:能用代码判的,永远先用代码。两者之外还有人工评审(金标准,但慢、贵、无法规模化)。