AI Agent (人工智能智能体)
定义
AI Agent 是指能够自主感知环境、规划行动、执行任务并适应变化的 AI 系统。与传统 AI 的”响应式”不同,Agent 强调”自主性”和”目标导向”。
根据 Google 2024 年 AI Agent 白皮书的定义:Agent 是一个扩展了生成式 AI 模型出厂能力的应用程序,通过观察周围世界并使用可用的工具来实现其目标。Agent 具有自主能力,即使是模糊的人类指令也可以推理出下一步行动。
工具的使用,是人类区别于动物的标志 — 也是 Agent 区别于大模型的标志。
Agent 与 Model 的区别 (Google 白皮书)
| 维度 | Model | Agent |
|---|---|---|
| 知识范围 | 限于训练数据 | 通过工具实时扩展 |
| 状态与记忆 | 无状态 | 有状态,管理会话历史 |
| 原生工具 | 无 | 有,内置工具支持 |
| 原生逻辑层 | 需提示词工程 | 原生认知架构 (CoT, ReAct 等) |
核心能力
| 能力 | 描述 |
|---|---|
| 感知 (Perception) | 理解输入、读取上下文 |
| 规划 (Planning) | 分解任务、制定执行步骤 |
| 行动 (Action) | 调用工具、执行操作 |
| 反思 (Reflection) | 评估结果、调整策略 |
技术架构
┌─────────────────────────────────────┐
│ AI Agent │
├─────────────────────────────────────┤
│ 规划层 (Planning) │
│ - 任务分解 │
│ - 步骤排序 │
├─────────────────────────────────────┤
│ 执行层 (Execution) │
│ - 工具调用 (MCP) │
│ - API 请求 │
│ - 代码执行 │
├─────────────────────────────────────┤
│ 记忆层 (Memory) │
│ - 短期上下文 │
│ - 长期记忆 │
├─────────────────────────────────────┤
│ 协作层 (Collaboration) │
│ - A2A 通信 │
│ - 多 Agent 协作 │
└─────────────────────────────────────┘
发展历程
- LLM + Prompt (2022-2023):基础对话模型
- LLM + Tool Use (2023-2024):引入工具调用
- Agentic AI (2024-2025):自主规划与执行
- Multi-Agent (2025+):多智能体协作
主流产品
| 产品 | 公司 | 特点 |
|---|---|---|
| Claude Code | Anthropic | 编程助手,深度代码理解 |
| OpenClaw | MiniMax | 开源 Agent,支持记忆 |
| Cursor | Anysphere | AI 代码编辑器 |
| Devin | Cognition | 全栈软件开发 Agent |
| Manus | Manus AI | 通用 Agent |
Google 白皮书三组件架构 (2024)
根据 Google AI Agent 白皮书,Agent 架构包含三个核心组件:
- 模型 (Model): 核心决策者,支持 ReAct、Chain-of-Thought、Tree-of-Thoughts 等推理框架
- 工具 (Tool): 连接外部世界的桥梁,三种类型:
- Extensions: Agent 端执行,直接调用 API
- Functions: 客户端执行,更精细的控制
- Data Stores: 向量数据库,实现 RAG
- 编排层 (Orchestration): 认知架构核心,负责记忆、状态、推理和规划 — 本质是”规划 — 执行 — 调整”的循环
关键技术标准
- MCP (Model Context Protocol):工具集成标准,与 Google Extensions 概念高度一致
- A2A (Agent-to-Agent):Agent 通信标准
- Harness Engineering:Agent 优化方法论
- Agent Chaining / Mixture of Agent Experts: 组合多个专业化 Agent 的战略方向 (Google 白皮书提出)
相关资源
标签
[2026-07-17] Agent 信息层栈成型 + Skill 工业化实证
- 信息层栈三层已在本批次开源项目中清晰分层:① 接入层 Agent-Reach(50.7k 星,MIT CLI 脚手架,打通 Reddit/X/小红书/B 站/公众号,Cookie 认证绕 API 成本
0 vs 官方200/月);② 过滤/打分层 last30days(4.6 万星 skill,并行扒多平台按真人互动量打分,v3 先认人认圈子再搜);③ 存储/检索层 OpenViking(2.6 万星,文件系统范式 + L0/L1/L2 分层 + 检索轨迹可视化)。 - 呼应本页 Google 白皮书三组件中 Tool 层(Extensions / Functions / Data Stores)的工业化分工——三层并非同类竞品,而是 Agent 感知→记忆栈的不同层:接入获取原始信号、过滤打分提炼价值、存储分层按需检索。
- Skill 工业化实证:sansheng-write(公众号写作流水线,19 脚本/12000+ 行/227 测试/7 质量门/状态机可恢复/verify 读像素验收)+ apple-design(17 条 WWDC 设计原则蒸馏,可中断性/材质层级/字体字距判断力框架)+ last30days(版本号/回归测试/质量评测)——Skill 正从”攒提示词加脚本”演进为工程化软件。
- 乐高式组合 + 日抛软件:sansheng-write 整合 baoyu-skills/gzh-design-skill/MiniMax/Gemini 各仓独立迭代,作者论断”Agent 时代软件正变日抛型,模型三个月一换代”——呼应 AI-Agent-Development 中罗福莉”模型是消耗品,框架是资产”论断。