智能体AI解析:当AI系统能够规划、使用工具并采取行动

代理式AI在多步执行循环中使用模型,这些模型可以在明确的运行时和权限边界内选择工具、观察结果、更新状态并调整其下一步行动。
已发布:
Aleksandar Stajić
已更新: 2026年10月8日 21:19
智能体AI解析:当AI系统能够规划、使用工具并采取行动

智能体AI是一种AI系统,其中模型可以通过决定下一步做什么、使用工具或其他能力、观察结果、更新其工作状态并持续进行,直到达到停止条件,从而跨多个步骤追求一个目标。模型本身并不是智能体。一个可用的智能体还需要一个运行时或执行框架,用于管理上下文、工具执行、状态、权限、审批、错误以及决策与观察之间的循环。

智能体AI的真正含义

从普通生成式AI到智能体AI的重要转变在于对流程的控制。普通助手可以使用接收到的上下文来回答问题。而智能体可以决定回答问题需要额外的步骤:检查文件、搜索代码库、查询API、请求澄清、运行测试、更新工单、委派子任务或在操作失败后重试。

这并不要求无限的自主权。智能体可以在狭窄的沙箱中运行,受到严格的权限限制,每个有后果的操作都需要审批。如果模型在允许的下一步中动态选择,该系统仍然是智能体的。

因此,架构比标签更重要。“智能体”应该描述一种系统行为:在工具、状态和反馈之上进行迭代的模型驱动决策——而不仅仅是一个拥有更大提示词的聊天机器人。

最简单的例子

假设一位开发者向AI系统提出:“找出测试套件失败的原因并修复这个bug。”单次模型调用只能根据给定的文本建议可能的原因。

一个智能体编码系统可以检查代码库、搜索失败的测试、阅读相关文件、提出修改、编辑代码、运行测试、观察失败、修改实现并再次运行测试。

智能体的部分不仅仅在于存在shell和文件工具,而在于模型可以利用环境反馈来选择下一步,而不是遵循一个完全预定义的序列。

基本的智能体循环

1
1. 接收目标
用户或上游系统定义目标和相关约束。
2
2. 构建当前上下文
运行时提供指令、状态、历史、记忆、工具和当前证据。
3
3. 模型决定下一步
模型可以回答、调用工具、请求信息、委派或停止。
4
4. 运行时验证请求
权限、模式、审批和策略决定所提议的操作是否可以执行。
5
5. 执行工具或操作
外部环境发生变化或返回新信息。
6
6. 观察结果
运行时将结构化的工具输出、错误或状态变化反馈到下一个模型步骤中。
7
7. 继续或停止
循环重复,直到成功、拒绝、升级、预算限制、超时或其他停止条件。

简单例子止步之处

并非每个多步骤AI系统都具有同等的智能体程度。一个工作流可能使用多个LLM调用和工具,但每一步都在代码中预先确定。另一个系统可能让模型决定调用哪个工具、以什么顺序、调用多少次以及何时停止。

两者都可能有用。区别在于控制权在哪里。预定义工作流将更多控制权放在应用代码中。智能体则将更多战术性流程决策移入模型/运行时循环中。

智能体与工作流

预定义工作流与代理式控制

LLM 工作流代理
流程路径
工具序列
优势
风险

Anthropic 明确区分了这两种模式:工作流通过预定义的代码路径编排模型和工具,而代理则让模型动态地指导自己的流程和工具使用。这不是唯一可能的术语,但它是一个有用的架构边界。

代理行为是一个谱系,而非二元标签

层级示例谁决定下一步?
单次模型调用总结这份文档应用程序调用模型一次
工具辅助响应模型在回答前可能使用网络搜索模型在一次响应中从有限工具中选择
结构化工作流分类 → 检索 → 生成 → 验证应用程序工作流决定阶段
自适应工作流模型可以在多个分支中选择并重试应用程序与模型共享控制权
代理循环模型根据观察反复选择工具/动作模型在运行时约束内指导战术执行
长期运行的代理代理暂停、恢复、管理产物并继续模型 + 持久化运行时管理不断演进的执行

将上述所有系统都称为“代理”可能会掩盖重要的操作差异。模型对顺序、持续时间和动作的控制越强,运行时隔离、权限、追踪、停止条件和轨迹评估就越重要。

代理系统的最小架构

组件职责
目标 / 任务定义系统试图完成什么。
模型解释上下文并决定下一个动作或输出。
指令定义角色、约束、优先级和任务特定策略。
上下文组装器构建每一步对模型可见的信息。
工具目录定义模型可以请求的能力。
运行时 / 执行框架运行循环、执行工具、管理状态并处理停止条件。
授权层确定当前主体是否被允许执行提议的动作。
状态 / 会话在轮次或执行步骤之间保留任务进度。
观察通道将工具结果和环境变化返回到下一个模型步骤。
审批 / 人工控制在需要审查时暂停有后果的动作。
追踪 / 审计记录模型调用、工具、转换、审批和失败。
评估根据验收标准衡量结果和执行轨迹。

模型不是代理

语言模型从输入产生输出。它本身并不拥有文件系统、执行 shell 命令、维护持久任务状态、强制执行权限或自动再次调用自身。

这些能力来自周围的运行时。同一个模型在一个应用程序中可以表现为简单的聊天模型,在另一个应用程序中可以表现为代理循环内的决策引擎。

工具使用是核心——但仅靠工具使用并不能构成代理

工具让模型获取信息并影响外部系统。示例包括数据库读取、文件操作、shell 执行、网络搜索、浏览器控制、API 调用、工单更新或委托专业代理。

单次模型调用可以使用一个工具,但仍然是有界的工具辅助响应,而不是长期运行的代理。当工具观察结果馈入一个自适应循环,模型在其中选择下一步做什么时,代理行为就出现了。

工具设计很重要,因为工具是模型推理与外部现实之间的契约。模糊或重叠的工具会造成路由错误;大型非结构化输出会污染上下文;广泛的副作用工具会扩大影响范围。

工具能力、权限和授权是不同的

层级问题
能力此运行时在技术上能否执行该操作?
工具暴露该能力是否对此代理可用?
权限在当前策略下,此代理/会话是否可以使用它?
用户授权请求主体是否被允许导致此操作?
业务授权该操作在领域规则、审批和限制下是否有效?
执行该操作是否实际发生?
审计系统能否证明谁请求、批准并执行了它?

这些层级在原型中经常被合并。模型看到一个退款工具,因此似乎能够发放退款。在生产环境中,工具仍应独立于模型的请求,验证账户、用户、交易、金额、策略和审批条件。

运行时或执行框架是实际的执行系统

OpenAI 当前的智能体文档明确区分了运行时。不同的运行时可以在不同位置管理编排、状态、工具、沙箱和执行,而模型只是系统的一部分。

Agents SDK 描述了一个循环:反复调用当前模型,检查输出,执行请求的工具或交接,并持续进行,直到模型返回最终答案或其他真正的停止点。

这意味着智能体架构决策包括:编排在哪里运行、状态存储在哪里、谁执行工具、哪个沙箱包含副作用,以及谁负责重试、超时和可恢复性。

规划有用,但不需要显式计划

智能体常被描述为“规划”的系统。在实践中,规划可以是显式的或隐式的。智能体可以先产生一个可见的多步骤计划,也可以一次选择一个下一步行动,并在每次观察后修正。

对于高度不确定的任务,短视界规划可能更安全,因为环境可能使长期计划失效。架构要求是能够根据目标、当前状态和新证据选择并修正行动。

环境反馈使循环变得有用

当智能体能够观察其行动是否有效时,它才具有操作意义。工具输出、测试结果、API 响应、文件系统状态、浏览器状态和应用程序记录提供了外部证据,系统可以用这些证据来修正下一个决策。

Anthropic 的智能体指南强调了这种反馈循环:智能体使用工具,从环境中获取真实情况,评估进展,并继续或请求人工输入。

智能体状态与模型上下文不同

长时间运行的任务可能需要无法或不应保留在模型上下文中的状态:任务 ID、检查点、工件、批准、外部对象标识符、重试计数器和工作流状态。

运行时可以将这种持久状态保存在模型窗口之外,并为下一步重建所需的上下文。这使模型可见的上下文保持专注,同时保持连续性和可恢复性。

记忆是可选的,不是智能体的定义

如果完整任务适合一次有界运行,智能体可以在没有长期记忆的情况下成功运行。当信息必须在会话、任务或长执行周期中持续存在时,记忆才变得有用。

RAG、记忆、状态和上下文解决不同的问题。将向量数据库视为“智能体记忆”或将对话历史视为“状态机”通常会隐藏重要的生命周期和权限边界。

上下文工程在智能体中变得动态化

每次工具调用都可能产生新的上下文。每一步也可能使之前的信息过时。因此,强大的智能体运行时会在执行过程中重建或整理上下文,而不是无限期地重放所有内容。

工具定义、任务状态、检索到的证据、观察结果和记忆都在争夺模型的注意力。长时间运行的智能体需要裁剪、压缩或即时加载,以使上下文与当前决策保持相关。

读取工具和副作用工具具有不同的风险

信息访问与外部操作

读取 / 观察写入 / 操作
示例
主要风险
典型控制

人在回路是一种控制机制,而不是智能体AI的对立面

智能体不会因为人类批准后续步骤而不再是智能体。模型仍然可以自主检查、推理、搜索和准备操作,而运行时在执行前要求人工确认。

OpenAI当前的智能体安全指南明确建议在较高风险的工作流中对工具操作进行审批。Anthropic同样强调在智能体遇到阻碍或重大决策时设置检查点和人工判断。

有用的架构问题不是“人类还是自主?”,而是哪些决策可以委托、哪些需要审查、哪些必须保持确定性?

智能体需要明确的停止条件

停止条件目的
成功验证的结果当外部目标状态得到确认时结束。
最大步数防止失控循环。
时间预算限制实际执行时间。
成本/令牌预算限制资源消耗。
重复动作检测器停止不再有进展的循环。
权限边界当下一个所需操作不被允许时暂停或停止。
人工审批检查点在后续执行前等待。
不可恢复的工具故障升级处理而不是无限重试。
不确定性阈值当任务无法安全推断时请求澄清。

恢复是智能体行为的一部分

智能体在会失败的环境中运行:API超时、文件更改、凭证过期、网页移动以及工具返回格式错误的输出。因此,有用的智能体系统需要恢复行为,而不仅仅是顺利路径的工具循环。

恢复可以包括有限重试、选择另一个工具、重新读取当前状态、询问用户、回滚部分操作或升级给人工。

重试还需要幂等性意识。重复读取通常风险较低;重复支付或发送消息可能会产生重复的副作用。

智能体AI不需要多个智能体

具有清晰工具集的单个智能体通常比多智能体架构更简单且更易于评估。当专业化能实质性改善工具隔离、策略隔离、提示清晰度、所有权或追踪可读性时,多个智能体才有用。

OpenAI当前的编排指南明确建议尽可能从一个智能体开始,只有当契约或所有权边界发生实质性变化时才添加专家。

多智能体系统带来了新的问题:委托质量、上下文重复、状态冲突、交接语义、身份、成本以及分布式故障处理。

智能体协议是互操作性层,而非智能体本身

诸如 MCP 和 A2A 之类的协议可以使智能体架构具备互操作性,但它们本身并不会创建智能体循环。MCP 可以暴露工具和资源。A2A 可以连接独立实现的智能体。应用程序仍然需要运行时、授权、状态、评估和领域逻辑。

这就是为什么协议能力必须与业务权限保持分离。通过 MCP 发现某个工具并不能证明当前主体有权使用它。通过 A2A 接收任务并不能证明远程智能体可以执行所有请求的操作。

轨迹是智能体可靠性的一部分

对于智能体系统而言,仅凭最终答案不足以作为证据,因为智能体可能通过不安全或无效的路径达到正确结果。它可能使用未经授权的工具、跳过必需的检查、重试副作用、依赖过时状态或意外成功。

因此,评估需要执行轨迹:决策、工具调用、审批、观察、状态变化和最终结果。当前 OpenAI 安全指南建议使用轨迹评分器和评估;Anthropic 的 2026 年智能体评估指南同样将多轮工具轨迹视为一等评估对象。

更严格的可靠性问题是:智能体是否通过可接受、可恢复且可审计的轨迹达到了可接受的结果?

智能体系统扩大了安全面

风险智能体为何会放大它架构应对
提示注入不可信内容可能影响未来的工具决策将指令与数据分离;约束工具;尽可能清理或结构化外部输入
权限过大推理错误可能变成真实的副作用最小权限、限定范围的凭证、按工具的策略和审批
凭证暴露工具可能需要强大的密钥将密钥保留在模型上下文之外;通过可信运行时代理访问
混淆代理智能体可能以比请求用户更广泛的权限行事将执行绑定到用户/服务身份,并对重大操作重新授权
失控循环模型反复调用工具而没有进展步数、时间和成本预算以及循环检测
状态漂移智能体制定计划后环境发生变化在重大操作前重新读取权威状态
间接注入工具/网页/文档内容包含针对模型的指令将外部内容视为不可信数据,而非指令权威
审计缺口最终结果无法显示执行了什么追踪工具调用、审批、身份和状态变化

智能体可观测性必须跟随循环

传统服务可观测性记录请求、延迟和错误。智能体可观测性需要额外的执行模型:哪个智能体处于活动状态、哪个模型版本做出了决策、有哪些上下文可用、选择了哪个工具、发送了什么参数、返回了什么结果以及执行为何停止。

对于敏感系统,轨迹本身需要访问控制和保留策略,因为提示、工具输出和工件可能包含机密数据。

如何评估智能体系统

维度问题示例证据
任务成功请求的结果是否发生?外部状态、测试、业务结果
轨迹质量步骤是否可接受?工具/操作轨迹
工具选择智能体是否选择了适当的能力?预期与实际工具调用
权限遵守是否保持在允许的权限范围内?授权日志和拒绝操作测试
状态处理是否使用了当前权威状态?新鲜度检查和状态变化测试
恢复是否对故障做出了正确响应?注入超时/错误场景
停止行为是否在正确的点停止?步数、循环检测、最终状态证明
人工升级在需要审查时是否提出?审批/升级轨迹
成本/延迟自主性是否值得运营成本?令牌、工具调用、持续时间
鲁棒性是否能在现实环境变化中存活?重复和对抗性试验

何时适合使用智能体

使用智能体的情况优先使用工作流或简单调用的情况
步骤的数量或顺序无法提前可靠确定序列稳定且确定
系统必须检查环境并做出适应单次检索加生成步骤就足够
根据中间结果,多个工具可能有用一个已知的 API 调用即可解决任务
任务受益于迭代验证或修复答案可以直接从提供的上下文中生成
失败需要灵活恢复行为失败分支简单,可以显式编码
可以在有意义的检查点插入人工审核每一步都是高风险的,无论如何都必须手动控制
预期价值足以证明额外的延迟、成本和复杂性是合理的可预测性和低成本比灵活性更重要

一个强有力的默认做法是:从能起作用的最简单方案开始,只有当灵活性带来可衡量的价值时,才增加智能体式复杂性。智能体用可预测性、延迟和成本来换取自适应执行。

原始实现证据

Aaasaasa AI Client:模型、运行时和权限是分离的

Aaasaasa AI Client 明确区分了智能体/客户端、提供者、模型、运行时位置和权限。其架构文档将权限视为核心的工具/工作区策略,而不是模型属性。

同一个应用可以在没有文件系统或 shell 工具的情况下提供 Direct Chat,而 Codex 运行时则在选定的工作区和权限配置文件下运行。这展示了一个核心的智能体架构边界:即使模型访问仍然可用,改变运行时/工具表面也会改变系统能做什么。

该仓库还区分了本地 Codex 运行时和模型位置:本地运行时可以调用云端模型。这避免了将“智能体在本地运行”等同于“推理在本地进行”的常见错误。

该实现禁用了那些审批语义不满足所需权限模型的嵌入式执行路径。这支持了这样一个原则:智能体能力不应仅仅因为底层框架可以执行工具,就绕过运行时授权。

Source of Truth Research Engine:有边界的智能体研究阶段

Source of Truth Research Engine 使用一个有边界的研究流水线:发现 → 获取 → 提取 → 验证 → 反驳 → 综合。研究任务可以通过 AI 运行时执行,而证据、来源、主张和矛盾则保留在外部持久化存储中。

这有意比不受约束的自主研究智能体更受控制。这些阶段为下一步应该发生什么样的工作提供了护栏,同时仍然允许在每个有边界的任务内部进行模型驱动的研究。

这种区分对智能体设计是有用的证据:自主性可以放在结构化的交付包络内,而不是统一应用到整个流程。

已实现的模式智能体架构经验
Direct Chat 没有操作系统工具模型可以存在,但不具备智能体执行能力。
Codex 运行时具有工作区权限配置文件工具权限属于运行时策略,而不是模型能力。
提供者/模型/运行时是分离的概念智能体框架位置和推理位置是相互独立的决策。
为具备工具能力的运行时设置权限代理能力暴露可以集中管理并受到治理。
有边界的研究阶段自主性可以在明确的流程边界内运行。
持久化的主张/证据位于模型上下文之外智能体状态和证据不必只存在于对话历史中。

常见的智能体式 AI 失败模式

失败模式实际失败的是什么
“智能体”只是一个在提示中列出工具的聊天机器人不存在可靠的运行时循环或工具执行架构
将工具支持视为权限能力边界和授权边界被混为一谈
智能体信任自己的完成声明结果没有根据外部状态进行验证
每个任务都变成多智能体在没有真正的所有权或专业化边界的情况下增加了复杂性
将对话历史用作持久状态可恢复性和权威状态变得脆弱
智能体盲目重试副作用可能出现重复消息、付款或状态变更
没有步骤/成本限制智能体可能无限循环或消耗不受控制的资源
将工具输出信任为指令间接提示注入可以重定向行为
只评估最终答案是否正确不安全或无效的轨迹仍然不可见
将模型升级视为透明工具选择、规划和停止行为可能发生变化
一个宽泛工具暴露许多特权操作影响范围扩大,意图变得更难验证
存在人工审批,但审核者缺乏上下文审批变成形式化,而不是有效

常见误解

误解纠正
“LLM 就是智能体。”模型是决策组件;智能体是管理工具、状态和迭代的周围系统。
“工具调用自动意味着智能体式 AI。”单次有边界的工具调用可能不涉及自适应的多步骤智能体循环。
“智能体必须完全自主。”智能体式系统可以要求审批,并在狭窄的权限边界内运行。
“智能体需要长期记忆。”记忆是可选的;许多有用的智能体在没有跨会话记忆的情况下完成有边界的任务。
“智能体必须先创建书面计划。”规划可以是显式的或隐式的,并且可以一次一步地进行。
“多智能体比单智能体更先进。”它更复杂;只有当专业化或所有权边界证明其合理时才使用它。
“MCP 创建了一个智能体。”MCP 暴露工具/资源;运行时仍然需要智能体循环和授权模型。
“本地运行时意味着模型是本地的。”运行时位置和推理/提供者位置是分离的。
“如果最终结果正确,智能体就正确工作了。”不安全或未经授权的轨迹仍然可能产生正确结果。
“人工审批消除了自主性。”审批可以约束选定的操作,而流程的其余部分仍然由模型指导。

实用的智能体设计顺序

从权限出发向外设计智能体

1
1. 定义结果
说明什么外部结果或产物能证明任务成功。
2
2. 判断是否真的需要智能体
当路径可预测时,优先使用简单调用或确定性工作流。
3
3. 识别状态和事实来源
定义哪些系统拥有当前事实、任务进度和业务状态。
4
4. 定义工具面
仅暴露任务所需的最小、清晰的能力集合。
5
5. 绑定身份和权限
区分用户权限、智能体/运行时权限和工具能力。
6
6. 选择自主性边界
明确模型可以动态决定什么,以及什么保持确定性。
7
7. 添加审批检查点
在适当情况下,要求对重大或不可逆操作进行审查。
8
8. 定义停止和恢复
设置成功证明、预算、超时、重试、升级和循环控制。
9
9. 设计上下文/状态管理
将当前状态、记忆、工具观察和持久产物保留在正确的层级中。
10
10. 追踪轨迹
记录足够的执行结构,以便调试和审计模型/工具决策。
11
11. 评估现实故障
测试过期状态、工具错误、提示注入、模糊请求和环境变化。
12
12. 仅依据证据扩大自主性
当评估显示收益足以证明风险合理时,再增加权限或执行范围。

智能体 AI 架构检查清单

问题预期证据
什么能证明成功?外部结果、产物、测试或权威状态。
为什么需要智能体?路径确实依赖中间观察结果。
哪些决策由模型驱动?明确的自主性边界。
存在哪些工具?小型、有文档、无歧义的能力集合。
谁可以使用每个工具?感知身份和上下文的授权策略。
哪些操作需要审批?基于后果的审查规则。
任务状态存放在哪里?由应用拥有的状态,与瞬态模型上下文分离。
智能体如何恢复?重试、重新读取、回滚、澄清和升级行为。
它如何停止?经验证的完成,加上步骤/时间/成本限制。
如何保护副作用?验证、幂等性、最小权限和确认。
执行过程能否被重建?工具、审批和状态转换轨迹。
如何评估它?结果 + 轨迹 + 鲁棒性测试。
模型/运行时更新后会发生什么变化?针对工具选择、权限、停止和恢复的回归测试套件。

边缘情况和限制

有些系统仅在狭义路由意义上具有“智能体”特征:模型选择一个专家或工具,然后工作流的其余部分是确定性的。这仍然可能有用,但不应被描述为等同于长时间运行的自主智能体。

高度重大的领域可能会刻意限制智能体的自主性。AI 系统可以检查证据、准备建议并填写结构化表单,而人类仍然是唯一被允许提交最终交易的行为者。

有些环境非常适合智能体,因为反馈是客观的。编码智能体可以运行测试;基础设施智能体可以检查指标;数据智能体可以验证查询结果。反馈较弱的开放式领域需要更谨慎的评估。

智能体可以完全在本地运行、完全通过托管云服务运行,或采用混合架构。智能体行为描述的是控制流,而不是托管位置。

“推理”一词不应用作智能体内部过程正确的证明。生产保障应依赖可观察的输入、动作、输出、状态和评估,而不是关于隐藏推理的不可验证主张。

什么会改变这个答案?

供应商 API 和智能体框架将继续演进,但架构边界是稳定的:模型提出决策,运行时管理循环,工具连接环境,权限约束动作,外部观察决定实际发生了什么。

随着模型变得更可靠,系统可能安全地委托更长的时间范围或更复杂的恢复行为。随着运行时验证和授权改进,一些审批步骤可能实现自动化。这些是自主性级别的变化,而不是基本责任层的变化。

推荐架构也会因后果而变化。一个只读取公开来源的研究智能体,与一个写入生产配置或转移资金的智能体,可以容忍不同的控制措施。

相关规范知识

智能体 AI 位于若干前置层之上:上下文工程决定模型看到什么;事实来源架构决定哪些信息是权威的;检索提供外部证据;运行时架构决定什么可以执行。

下游节点包括工具调用、MCP、A2A、智能体身份、权限、可审计性、人在回路、编排、记忆和多智能体系统。

因此,协议栈文章应在基本智能体概念之后阅读:协议标准化智能体周围的边界;它们并不定义智能体行为本身。

常见问题

智能体AI常见问题

什么是智能体AI?

智能体AI是一种AI系统,其中模型可以通过选择行动或工具、观察结果、更新状态并持续进行,直到达到停止条件,从而在多个步骤中追求一个目标。

LLM和AI智能体有什么区别?

LLM从输入产生输出。智能体将模型与运行时、工具、状态、权限、上下文管理和迭代执行循环相结合。

工具调用是否使系统成为智能体?

不一定。单个工具辅助的模型响应可能是有界的且非智能体的。当工具观察驱动自适应多步循环时,智能体行为才会出现。

智能体和AI工作流有什么区别?

工作流通常遵循应用程序代码中定义的流程路径。智能体根据中间观察,对使用哪些步骤和工具拥有更多由模型驱动的控制权。

智能体需要记忆吗?

不需要。长期记忆对于跨会话的持久信息很有用,但许多智能体仅使用当前任务状态和上下文即可完成有界任务。

AI智能体需要多个智能体吗?

不需要。单个智能体通常更简单。当专业化、工具隔离、策略隔离或所有权边界能实质性改善系统时,多智能体系统才是合理的。

智能体可以有人工参与吗?

可以。智能体可以自主执行低风险分析和准备,而运行时在后果性行动之前暂停以等待人工批准。

MCP是智能体框架吗?

不是。MCP是一种用于暴露工具、资源和提示的互操作性协议。智能体运行时可以使用MCP,但仍需要自己的循环、状态、授权和评估。

如何知道智能体实际完成了任务?

在可能的情况下,通过外部状态、测试、工件或权威系统记录来验证成功,而不是信任模型自己的完成声明。

术语表

关键智能体AI术语

智能体AI
AI系统行为,其中模型使用工具、观察和状态动态指导多步执行以实现目标。
AI智能体
以模型为中心的系统,具有运行时、工具、状态和执行循环,可以在多个步骤中追求任务。
智能体循环
模型决策、工具/行动执行、观察和更新模型决策的重复循环,直到停止。
运行时/框架
管理模型循环、工具、状态、批准、上下文、错误和停止条件的执行层。
工具
暴露给模型的能力,用于读取信息、计算、委托或改变外部状态。
观察
从工具或环境返回并供应给后续智能体步骤的信息。
智能体状态
存在于单个模型输出之外的持久任务或执行信息,可能跨步骤或暂停而存活。
自主边界
明确定义模型可以动态控制哪些决策和行动的显式限制。
人工参与
一种控制模式,其中在AI驱动过程的选定点需要人工审查、输入或批准。
轨迹
任务请求和最终结果之间相关状态、决策、工具调用、行动和观察的序列。
幂等性
允许操作重复执行而不会无意中多次应用相同副作用的属性。

结论

智能体AI不仅仅是更聪明的模型或拥有更多工具的聊天机器人。它是一种系统架构,其中模型参与迭代控制循环:决策、行动、观察、更新并继续。

模型提供灵活的决策制定,但周围的运行时必须拥有执行现实:权限、工具访问、状态、批准、重试、预算、停止条件、追踪和验证。

因此,最有用的设计原则是:仅在明确的技术和业务边界内将战术选择委托给模型。只有当自主性、权威和证据保持可分离时,智能体能力才能成为生产能力。

主要来源和当前指南

以下来源支持当前围绕智能体、工作流、循环、工具、编排、安全和评估的架构区分。项目部分是原始实现证据,并明确限定于仓库所展示的内容。

OpenAI — 智能体

当前开发者指南,定义多步工作、工具、状态、编排和智能体执行的运行时选择。

OpenAI — 智能体定义

当前文档将智能体描述为模型加上指令和可选运行时行为,包括工具、护栏、MCP服务器和交接。

OpenAI — 运行智能体

当前关于智能体循环的文档:模型调用、工具执行或交接、继续和最终停止点。

OpenAI — 编排和交接

当前关于交接、智能体即工具以及专家智能体何时增加有用所有权或能力边界的指南。

OpenAI — 构建智能体中的安全

当前安全指南,涵盖工具批准、提示注入、护栏和基于追踪的评估。

Anthropic — 构建有效智能体

工程指南,区分预定义工作流和模型指导的智能体,并描述基于工具的环境反馈循环。

Anthropic — AI智能体的有效上下文工程

将智能体实际框架为LLM在循环中自主使用工具,并具有动态即时上下文管理。

Anthropic — 揭秘AI智能体的评估

2026年关于评估多轮智能体的指南,这些智能体调用工具、修改状态并适应中间结果。

Related Articles

LLM从哪里获取数据?Python中的RAG数据源

LLM从哪里获取数据?Python中的RAG数据源

LLM 并不会神奇地知道你的文件、数据库或 API。这个 RAG 系列的实用续篇用简单的 Python 展示了外部数据如何变成可检索的证据:从文本文件和 SQL 到全文搜索、嵌入、上下文组装以及最终的 LLM 调用。

AI Agent可靠性:为什么最终答案并不足够

AI Agent可靠性:为什么最终答案并不足够

正确的输出并不能证明推理的正确性、执行的安全性,或系统的可信赖性。

AI代理应该记住、遗忘、重新计算还是再次检索什么?

AI代理应该记住、遗忘、重新计算还是再次检索什么?

长时间运行的代理不应记住所有内容。本文提供了一个实用的生命周期模型,用于决定哪些内容应属于持久记忆、哪些内容应重新检索、哪些内容重新计算更安全,以及哪些内容应过期或被取代。

什么是AI平台架构师?模型、数据、运行时、安全与运维

什么是AI平台架构师?模型、数据、运行时、安全与运维

AI平台架构师负责跨模型、提供商、检索、智能体、身份、安全、评估、可观测性和运营设计可复用的AI基础。

GPU 不是产品:面向未来的私有 AI 架构

GPU 不是产品:面向未来的私有 AI 架构

私有 AI 基础设施不应围绕单一 GPU 或单一模型来设计。更具韧性的做法是将快速推理 GPU、内存充裕的 AI 系统、物理 AI 节点以及可选的前沿云模型,统一置于一个具备能力感知的路由层之后。

答案有效性边界:相关性到可靠AI答案之间缺失的层级

答案有效性边界:相关性到可靠AI答案之间缺失的层级

一个来源可能相关、权威,但对于所提出的问题仍然是错误的。缺失的层次是适用性:答案成立的条件,以及迫使其被重新考虑的变化。本文介绍了“答案有效性边界”这一面向人类、AI搜索和RAG系统的来源设计模式。

什么是AI解决方案架构师?系统边界、职责与权衡

什么是AI解决方案架构师?系统边界、职责与权衡

AI解决方案架构师将业务需求转化为生产就绪的AI系统,涵盖数据、模型、工具、安全、运行时、评估和运维。

企业AI架构:当AI进入公司时会发生什么变化

企业AI架构:当AI进入公司时会发生什么变化

企业AI架构阐释了AI如何在数据权限、身份、许可、提供商、风险、治理、评估、合规和运营方面改变公司系统。

AI系统中的真相来源:可靠知识究竟从何而来

AI系统中的真相来源:可靠知识究竟从何而来

事实来源(Source of Truth)定义了对于特定事实或状态,哪个来源具有权威性。了解它与RAG、溯源、记忆、上下文、向量数据库和记录系统有何不同。

人工智能何时应停止信任自身知识?——检索触发机制

人工智能何时应停止信任自身知识?——检索触发机制

AI 模型并非每个问题都需要检索。重要的问题在于知道何时其内部知识已不再足够。检索触发器是一个实用的决策边界,它决定 AI 系统何时应停止仅依赖模型知识,并在回答前获取外部证据。

向量数据库、嵌入和重排序:检索的三个不同部分

向量数据库、嵌入和重排序:检索的三个不同部分

嵌入表示含义,向量数据库检索候选结果,重排序器则精炼结果。了解这三个检索层在RAG中如何不同并协同工作。

生成式人工智能解析:模型、检索、工具与应用并非同一回事

生成式人工智能解析:模型、检索、工具与应用并非同一回事

生成式AI不仅仅是一个模型。了解模型、检索、工具、上下文、运行时和应用程序如何在生产AI系统中协同工作。