思考-行动交替(Reasoning-Acting) 核心概念
别名:
思考-行动-观察
ReAct 的核心编排机制:模型先推理(Thought),harness 执行工具(Action),结果回填为观察(Observation),如此循环直到不再需要工具。见[第 12 章](/chapters/12-classic-paradigms/)。
它是什么
「思考-行动交替」是 ReAct 的核心编排机制,也叫 Thought → Action → Observation(思考 → 行动 → 观察)循环:模型先推理(Thought),harness 执行工具(Action),工具结果回填为观察(Observation),观察成为下一轮思考的输入。
三方分工
循环里三方各司其职:模型只决定(输出文本 + 结构化 tool_calls),harness 只执行(调用工具、把结果回填成 tool 消息),观察只喂给下一轮。模型不碰真实世界,harness 不替模型做决策——这个分工让「谁负责思考、谁负责行动」在代码里一目了然,也让思考轨迹可以被完整记录与审计。
在本教程的位置
第 07 章的最小 Agent Loop(think → act → observe)就是它的第一个实现;第 12 章把它显式化为 ReAct 范式并记录 thoughts 轨迹。它与范式的关系是「机制 vs 模板」:思考-行动交替是机制,ReAct 是把它作为控制流的一套范式。