Eval(评估) 评测与工程
别名:
评估
给 AI 系统写的测试:给定输入,用判定逻辑检查输出,衡量成功与否。Agent 是概率系统,没有评估就是盲改——改一行提示词可能修好一个任务、弄坏另一个。见[第 13 章](/chapters/13-eval-basics/)。
它是什么
Eval(评估)是给 AI 系统写的测试:给定一个输入,用判定逻辑检查它的输出,衡量成功与否。Agent 是概率系统——提示词、模型、工具、上下文任何一环的改动,都可能让一部分任务变好、另一部分悄悄变坏,而且往往在你看不到的地方(第 13 章开场反例:改一行「要简洁」的 prompt,修好了啰嗦、弄坏了查景点)。没有评估就是盲改。
最小模型
评估的最小模型三件套:任务集(固定、可判定的成功标准)+ grader(规则优先,规则表达不了的维度才上 LLM-as-judge)+ 跑批汇总(改动前后各跑一遍同一批任务,用通过率与失败模式分布对比回归)。核心洞察是判题对象是 trace 而不是最终答案:轮数、工具调用、工具结果都是可观察行为,「答案对了但烧了 6 轮」这种失败,只看答案永远发现不了。
在本教程的位置
第 13 章手写完整的最小 harness:ruleGrader(contains / tool_called / tool_args 三类断言)、classifyFailure(planning / tool / efficiency 三桶 + 确定优先级)、runEval(跑批 + 汇总报告)。写完的这套东西就是后续章节产品的质量闸门:每加一个能力,先跑一遍任务集确认没弄坏旧行为。