封面

Agent 是怎么“自己干活”的?

写作时间:2026-08-27 12:00:00
# ai-agent

一、选题背后的深度调研(写作素材库)

核心公式(全行业通用定义)

Agent = 大模型(大脑)+ 规划 Planning + 工具调用 Tool Use + 记忆 Memory + 执行循环 Loop

聊天机器人解决"怎么回答",Agent 解决"怎么完成"——本质差别是"执行闭环"。

执行循环:ReAct(Reason + Act)

Thought(推理)→ Action(调用工具)→ Observation(观察结果)→ 循环,直到任务完成/到达上限
  • 原始论文:Yao et al. 2022(arXiv:2210.03629),ReAct 在 ALFWorld 上 +34 分、WebShop +10 分,并通过逐步检索降低幻觉。
  • 2026 年所有主流 Agent(Claude Code、Cursor、Devin、Operator 等)本质都是该循环的变体。
  • 一个生产级循环必备 5 要素:消息缓冲、工具注册表、停止条件、步数预算(防死循环)、结果格式化(工具报错须转成可读文本回喂模型)。

四大模块要点

  1. 规划:把模糊目标拆成子任务。技术谱系:CoT 思维链 → ToT 思维树(支持回溯,GPT-4 在 Game of 24 从 4% 提升至 74%)→ Plan-and-Execute → Reflexion(自我反思重试,GPT-4 在 HumanEval 达 91%)。
  2. 工具调用:模型输出结构化 tool_use(JSON Schema 约定),客户端执行后将结果回填上下文;2026 年已支持并行工具调用(一次调用多个工具,降低时延)。
  3. 记忆三层:短期=上下文窗口;会话级=跨轮摘要再注入;长期=情节记忆(事件)/语义记忆(事实)/程序记忆(偏好),依赖向量检索(RAG)。
  4. MCP:Anthropic 2024.11 提出,2025.12 移交 Linux Foundation(OpenAI、AWS、Google、微软均为铂金成员);2026 年月 SDK 下载约 9700 万,公开 server 1 万+。→ 本篇只做钩子,03 专讲。

关键数据卡(写稿备用)

数据 来源
单步失败率 5% × 20 步 ≈ 整体成功率仅 36% 行业工程共识
全自主 Agent 需要端到端失败率 <1% 多家工程团队口径
MCP 月 SDK 下载约 9700 万,公开 server 1 万+ 2026 年 MCP 生态报道
30% 企业软件厂商 2026 年将发布 MCP server Forrester
2025.12 MCP 移交 Linux Foundation,五大厂商站台 Knak / Avaya 报道
2026 趋势:原生推理通道与工具调用在架构上分离 Responses API 世代

金句库

  • "Chatbot 解决'如何回答',Agent 解决'如何完成'。"
  • "Agent 的本质,是具备推理能力的大模型 + 可执行的环境 + 验证与修正机制。"
  • "单步 5% 的失败率,在 20 步任务中意味着整体成功率不足 40%。"
  • "模型的竞争在收敛,产品的竞争在执行。"

二、可直接发布的笔记文案

标题(三选一)

  • A(推荐):AI Agent 是如何"自己干活"的?拆解从规划到执行的完整闭环
  • B:一篇看懂 Agent:大模型如何从"会说话"走向"会做事"
  • C:Agent 的底层逻辑:规划、工具调用与记忆的三层架构

封面文案(建议白底结构图/流程图,排版克制,3:4)

AI Agent
工作原理拆解

备选:从"会说话"到"会做事" / 规划 · 工具 · 记忆

正文

上期我们讨论了厂商集体押注 Agent 的商业逻辑,本期回答技术问题:Agent 到底如何工作?

业内普遍认可的定义是: Agent = 大模型 + 规划 + 工具调用 + 记忆 + 执行循环 它与聊天机器人的本质区别,在于从"生成回答"转向"完成任务"。

01 规划:把任务拆成可执行步骤 以"预订下周去上海的机票"为例,Agent 会先分解:查询行程 → 搜索航班 → 比价 → 下单 → 确认。这一能力依赖思维链(CoT)、思维树(ToT)等技术,是多步任务的前提。

02 工具调用:让模型真正"动手" 规划完成后,Agent 通过结构化接口执行操作:读取日历、调用订票系统、提交订单。2026 年,这些接口正在向统一的 MCP 协议收敛——相当于工具的通用接口标准(下期展开)。

03 执行循环:边执行、边验证 Agent 的核心机制是 ReAct 循环,即推理与行动交替进行:每执行一步,观察结果;不符合预期,则修正后重试。正是这个闭环,让它区别于单轮问答。2026 年的新趋势是原生推理——推理与工具调用在架构上分离,可靠性与成本进一步优化。

04 记忆:短期与长期 短期记忆维护当前任务状态;长期记忆沉淀用户偏好与历史经验。缺乏记忆的 Agent,无法胜任跨会话的个性化任务。

同时需要正视现状:幻觉、循环卡死、越权操作是三类典型风险。工程上,单步 5% 的失败率在 20 步任务中意味着整体成功率不足 40%,这也是行业坚持关键操作须人工确认的原因。

总结:Agent 的本质,是"具备推理能力的大模型 + 可执行的环境 + 验证与修正机制"。看懂它,才能看懂这场竞赛的走向。

问题留给你:你愿意让 Agent 自主决策的金额上限是多少?评论区聊聊。

标签

#AI #人工智能 #AI智能体 #大模型 #科技科普 #知识分享 #硬核科普 #AI科普 #Agent #前沿科技


三、执行建议(简短)

  1. 配图:白底结构图/流程图(公式图、ReAct 循环图、风险清单卡),排版克制、避免贴纸花字,与专业人设一致;正文可配 4 张卡片图:公式卡、拆任务卡、循环卡、风险卡。
  2. 系列钩子闭环:01 结尾预告本篇,本篇结尾预告 03(MCP);发布 03 时在评论区置顶 01/02 链接,形成追更路径。
  3. 互动题设计:以"金额阈值"取代娱乐化提问,既贴合专业定位,又天然形成观点分歧,利于评论区讨论;回复评论时保持同一克制口吻。
  4. 发布时间:与 01 间隔 2–3 天,固定 12:00–13:00 或 20:00–22:00。