什么是 DeepAgents?
DeepAgents 是一种面向长时、多步骤任务的 AI 智能体系统。它让模型先理解目标和约束,再规划步骤、调用工具、观察结果、修正方案,最后交付经过检查的结果。
换句话说,DeepAgents 不是“多聊几轮的聊天机器人”,而是一种把思考、计划、行动和反馈组织成执行循环的 agent 架构。它解决的是:当任务不能靠一次生成完成时,AI 如何保存进度、处理新信息,并在中途出错后继续推进。

“DeepAgents”目前有两种常见用法:
- 泛指一种架构思路:任何具备长时规划、状态管理、工具使用和验证回路的智能体系统,都可以被称为 deep agent。
- 特指一个开源实现:LangChain 的
deepagents是构建在 LangGraph 等组件之上的 agent harness,提供文件系统、上下文管理、子智能体和记忆等能力。
本文先解释通用架构,再在相关位置说明工程实现。这样理解后,读者不会把一个产品名称误认为统一的行业标准。
DeepAgents 的三个核心能力是什么?
DeepAgents 的核心能力可以归纳为三类:
- 深度推理:把复杂目标拆成问题、证据和判断,而不是只生成一个看似完整的答案。
- 长期规划:维护任务状态和待办步骤,跨越多轮模型调用,必要时重新安排后续工作。
- 自主行动:根据当前状态选择搜索、数据库、计算器、代码解释器或业务 API 等工具,并读取返回结果。

这三个能力缺一不可。只有推理没有行动,AI 仍然无法获取实时数据;只有工具没有规划,系统容易机械地乱调用;只有规划没有记忆,长任务会在上下文变长后丢失进度。
为什么 DeepAgents 需要“深度”?
这里的“深度”不是指把模型的私有思维链原样展示给用户,也不是简单增加回答字数。它指的是系统能够在较长的任务周期内保留中间状态,逐步建立问题结构,并用新证据改变下一步决策。
普通问答可以抽象成“输入 → 一次生成 → 输出”。DeepAgents 更接近下面的循环:
- 理解目标:识别交付物、时间、预算、权限和其他约束。
- 拆分问题:把大目标变成可执行、可验收的子任务。
- 搜索与阅读:调用工具获取资料,记录来源和中间结果。
- 整合与判断:比较证据,发现冲突,决定下一步路径。
- 验证与调整:检查结果是否满足完成条件;不满足就重试或重新规划。

例如“写一份市场分析报告”至少需要回答行业现状、竞争对手、数据来源和结论边界。智能体可以先建立这些子问题,再分别检索和整理,最后让验证步骤检查数据的时间、口径和来源。这样的流程能减少因遗漏步骤导致的错误,但不能保证事实一定正确;事实仍然需要可靠来源和外部验证。
DeepAgents 通常由哪些模块组成?
一个 DeepAgent 的概念模型通常包含四个模块。不同框架可能把它们实现成 middleware、工具或状态节点,但职责可以这样理解:
| 模块 | 负责什么 | 典型工程实现 |
|---|---|---|
| 记忆模块 | 保存当前目标、已完成步骤、用户偏好和可复用信息 | 会话状态、检查点、数据库或长期记忆存储 |
| 规划模块 | 生成待办列表,决定顺序,处理依赖和重新规划 | todo 工具、状态图、调度器 |
| 工具使用模块 | 连接模型之外的世界,执行查询、计算和写入 | 搜索、数据库、代码执行器、MCP、业务 API |
| 反思模块 | 检查中间结果和完成条件,触发重试或人工审批 | 规则校验、评估器、测试、人工确认 |

运行时可以用一个简化伪代码表示:
state = load_task_state()
while not state.done and state.steps < MAX_STEPS:
plan = planner(state)
action = agent.choose_action(plan, state, available_tools)
observation = execute(action)
state = update_state(state, action, observation)
if should_replan(state) or should_request_approval(state):
state = revise_plan(state)
return verifier(state)
这个循环的重点是“状态持续更新”,而不是把一段很长的提示词交给模型。生产系统还应记录工具输入、输出、耗时、错误和审批结果,方便追踪任务究竟在哪一步失败。
DeepAgents 如何一步一步完成出差预订?
假设用户提出:“帮我安排下周的上海出差,符合公司预算,先给我方案,不要直接付款。”一个合格的 DeepAgent 不应该直接返回一张机票链接,而应按依赖关系推进:
- 读取日程:确认会议时间,推导可出发和返回的时间窗口。
- 查找约束:在授权的邮件或知识库中找到交通、酒店预算和报销规则。
- 查询并比较:调用机票和酒店 API,统一价格、退改规则、到达机场等字段。
- 处理冲突:发现时间冲突、预算超标或数据缺失时,调整筛选条件或向用户提问。
- 提交审批:给出候选方案、来源和总价,等待用户确认后才执行预订或付款。

图中的日期、价格和预算是演示数据,不是任何航空公司或企业的真实报价。这个案例真正要说明的是执行顺序:后一步依赖前一步的结果,且涉及付款等不可逆动作时必须设置人工审批。
DeepAgents 的“深度”如何发现隐藏关联?
深度智能体不只汇总表面信息,还会主动定义比较维度和时间范围。例如整理产品用户反馈时,它可以先按问题类型聚类,再比较最近三个月与更早数据,最后把异常趋势和版本发布时间对齐。
如果结果显示“充电慢”相关评论在更新后上升,系统还需要继续检查样本量、渠道分布、评价口径和其他可能原因,不能仅凭时间先后就断言固件更新导致问题。跨时间关联的价值在于提出可验证的假设,而不是自动制造因果结论。

图中的 40% 和 +38% 是用于解释分析过程的示例数字。真正上线时,报告应附带数据范围、计算方法和原始来源。
DeepAgents 如何反思、回溯和自我修复?
反思模块不是让模型“凭感觉再想一次”,而是把检查点和明确的验收标准加入执行流程。常见闭环包括:
- 执行:完成一个工具调用或子任务,并保存输入输出。
- 检查:验证格式、数值范围、引用、权限和业务规则。
- 评分:判断结果是否达到阈值,记录失败原因。
- 回溯:回到出错步骤,修改关键词、参数或计划后重新执行。

可追踪日志能帮助工程师定位问题,但日志不等于模型真实的“内心想法”。实践中应记录可审计的计划摘要、工具调用和验证结果,避免把未经验证的模型解释当作事实依据。反思也不是无限重试:应设置最大步数、成本预算和人工接管条件。
DeepAgents 和传统自动化有什么区别?
传统 RPA 或脚本自动化执行预先写好的步骤;DeepAgents 以目标、状态和工具为中心,根据环境反馈选择下一步。两者不是互相替代的关系:稳定、规则明确的流程通常仍应优先使用确定性自动化,只有不确定性较高且收益足够时才引入智能体。
| 维度 | DeepAgents | 传统自动化 / RPA |
|---|---|---|
| 控制方式 | 目标、状态和条件驱动 | 固定脚本和规则驱动 |
| 对输入变化的适应 | 可根据工具结果重新规划 | 通常需要修改流程或脚本 |
| 适合任务 | 研究、异常处理、跨系统判断 | 固定字段搬运、定时任务、确定性审批 |
| 可解释性 | 需要依赖计划、调用和审计日志 | 步骤通常更容易静态审查 |
| 成本与延迟 | 模型和工具调用较多,通常更高 | 可预测,通常较低 |
| 主要风险 | 错误规划、工具误用、权限和提示注入 | 规则覆盖不足、流程变更后失效 |

例如“发送周报”如果每周数据源数量变化,DeepAgents 可以跳过缺失源并在报告中注明;但对于工资计算、付款和生产系统变更,确定性规则、权限校验和人工审批通常更可靠。选择标准不是“哪个更智能”,而是任务是否值得承担模型的不确定性。
DeepAgents 有哪些限制和安全风险?
DeepAgents 增加了自主性,也增加了系统需要管理的风险。至少要关注以下问题:
- 计划错误:模型可能遗漏依赖、误解目标,或在错误方向上持续执行。
- 工具和数据错误:API 超时、权限不足、数据过期或字段口径不一致都会污染后续判断。
- 成本与延迟:多轮推理、检索、代码执行和重试会增加 token、调用次数和响应时间。
- 提示注入:网页、邮件或文档中的恶意指令可能诱导智能体泄露信息或调用高风险工具。
- 权限与不可逆动作:发邮件、写数据库、付款和删除文件都应使用最小权限、沙箱和人工确认。
- 循环失控:没有最大步数、超时和预算上限时,智能体可能反复重试。
上线前至少应记录任务成功率、工具错误率、重规划次数、单任务成本、端到端延迟和人工接管率,并为高风险工具配置审批门槛。DeepAgents 的目标是提高复杂任务的完成能力,不是让系统在没有边界的情况下自行决定一切。
DeepAgents 适合哪些任务?
可以先用三个问题判断:任务能否拆分?是否需要外部工具或跨时间状态?结果是否可以逐步验证?如果大多数答案为“是”,再考虑使用 DeepAgents。
| 任务 | 适合度 | 原因 |
|---|---|---|
| 深度调研与资料整合 | 高 | 可拆分研究方向,并检查来源和冲突 |
| 软件研发与测试 | 高 | 可读写文件、运行测试、根据失败结果修复 |
| 供应链异常分析 | 中高 | 需要跨系统查询和时间序列比较 |
| 医疗文献审查 | 中高 | 可辅助筛选和提取,但结论必须由专业人员复核 |
| 简单翻译或一次性摘要 | 低 | 多步骤规划带来的收益小于额外开销 |
| 付款、删库等不可逆操作 | 谨慎 | 必须加入权限隔离和人工审批 |
常见问题
DeepAgents 是一个具体产品吗?
不一定。它可以泛指一类面向长时、多步骤任务的智能体架构,也可以指 LangChain 的 deepagents 开源 agent harness。阅读文档或选型时,应先确认上下文中的 DeepAgents 指哪一层。
DeepAgents 和普通 AI Agent 有什么区别?
普通 AI Agent 也可以调用工具并自主决策;DeepAgents 通常强调更长的任务跨度、更完整的上下文管理、任务规划、文件或工作记忆,以及失败后的恢复机制。两者没有统一的硬性分界线。
DeepAgents 会展示完整思维链吗?
不会因为使用了 DeepAgents 就应该展示模型的私有思维链。生产系统更适合输出可审计的计划摘要、工具调用、证据和验证状态;这些信息足以解释流程,也能减少敏感推理内容泄露。
DeepAgents 一定能减少幻觉吗?
不能保证。分步规划、检索和验证可以减少遗漏,并让错误更容易定位,但错误来源、工具返回值和评估规则本身仍可能出错。高风险结论必须依赖可靠数据源和人工复核。
DeepAgents 和 RAG、MCP 是什么关系?
RAG 主要负责从外部知识库检索相关内容;MCP 是连接模型应用与工具、资源的协议;DeepAgents 是负责规划和执行的更高层智能体系统。DeepAgents 可以把 RAG 或 MCP 工具纳入自己的执行循环,但它们不是同一个概念。
什么时候不应该使用 DeepAgents?
当任务步骤固定、输入结构稳定、延迟和成本要求严格,或结果无法接受模型不确定性时,普通函数、工作流引擎或 RPA 通常更合适。不要为了“自主”而给简单流程增加不必要的模型调用。
总结:DeepAgents 的本质是什么?
DeepAgents 是让 AI 面向复杂目标持续工作的架构:它保存状态,拆解任务,调用工具,观察结果,按验收标准反思,并在必要时重新规划。它把 AI 从一次性生成内容,推进到可追踪的目标驱动执行。

记住三点即可:
- 深度意味着长任务中的状态、依赖和验证,不等于展示私有思维链。
- 智能体的关键是观察、决策和行动循环,不是模型名称或提示词长度。
- 工程可靠性来自边界和证据:最小权限、可审计日志、结束条件、外部验证和人工审批都不可省略。
一句话总结:DeepAgents 让 AI 学会先想清楚要做什么,再用工具把事情推进下去;至于能否把事情办牢,取决于系统为它设置了怎样的状态、验证和责任边界。

