任务集(Test Set) 评测与工程
别名:
测试集 · eval suite
一簇测同一能力的任务集合,每个任务 = 输入 + 成功标准(断言 + 步骤预算)。任务集一旦建立就冻结,改动前后跑同一批任务才能对比回归。见[第 13 章](/chapters/13-eval-basics/)。
它是什么
任务集(Test Set / Eval Suite)是一簇测同一能力的任务集合,每个任务 = 输入 + 成功标准(断言 + 步骤预算)。它是「成功长什么样」的载体:评估的第一步不是写代码,是定义成功——Task { id, prompt, checks, budget },checks 是断言数组,budget 是步骤预算(超过即效率失败)。
任务从哪来
实践中三个主要来源:真实用户请求(从日志里挑有代表性的,任务集的骨架)、失败样本(线上出过问题的输入务必收进来,防止它再次出现)、边界与对抗(故意刁难 Agent 的输入,逼它别偷懒)。写任务集有两条纪律:断言可判定不写空话(「回答要友好」不是规则能判的,「答案包含拙政园」才是);任务集一旦建立就冻结——想加新任务往新的一批里加,别动旧的,否则改前改后的分数没法对比。
在本教程的位置
第 13 章用一个 6 任务的演示集覆盖全部四种判定(通过 / planning 失败 / tool 失败 / efficiency 失败),其中 t4 的玄机是「难在别多做事」——断言全过但烧了 6 轮(预算 3)。回归评估(regression)的对比基础就是这份冻结的任务集。