AI Agent (人工智能智能体)

定义

AI Agent 是指能够自主感知环境、规划行动、执行任务并适应变化的 AI 系统。与传统 AI 的”响应式”不同,Agent 强调”自主性”和”目标导向”。

根据 Google 2024 年 AI Agent 白皮书的定义:Agent 是一个扩展了生成式 AI 模型出厂能力的应用程序,通过观察周围世界并使用可用的工具来实现其目标。Agent 具有自主能力,即使是模糊的人类指令也可以推理出下一步行动。

工具的使用,是人类区别于动物的标志 — 也是 Agent 区别于大模型的标志。

Agent 与 Model 的区别 (Google 白皮书)

维度ModelAgent
知识范围限于训练数据通过工具实时扩展
状态与记忆无状态有状态,管理会话历史
原生工具有,内置工具支持
原生逻辑层需提示词工程原生认知架构 (CoT, ReAct 等)

核心能力

能力描述
感知 (Perception)理解输入、读取上下文
规划 (Planning)分解任务、制定执行步骤
行动 (Action)调用工具、执行操作
反思 (Reflection)评估结果、调整策略

技术架构

┌─────────────────────────────────────┐
│           AI Agent                  │
├─────────────────────────────────────┤
│  规划层 (Planning)                 │
│    - 任务分解                       │
│    - 步骤排序                       │
├─────────────────────────────────────┤
│  执行层 (Execution)                 │
│    - 工具调用 (MCP)                 │
│    - API 请求                       │
│    - 代码执行                       │
├─────────────────────────────────────┤
│  记忆层 (Memory)                   │
│    - 短期上下文                     │
│    - 长期记忆                       │
├─────────────────────────────────────┤
│  协作层 (Collaboration)            │
│    - A2A 通信                      │
│    - 多 Agent 协作                 │
└─────────────────────────────────────┘

发展历程

  1. LLM + Prompt (2022-2023):基础对话模型
  2. LLM + Tool Use (2023-2024):引入工具调用
  3. Agentic AI (2024-2025):自主规划与执行
  4. Multi-Agent (2025+):多智能体协作

主流产品

产品公司特点
Claude CodeAnthropic编程助手,深度代码理解
OpenClawMiniMax开源 Agent,支持记忆
CursorAnysphereAI 代码编辑器
DevinCognition全栈软件开发 Agent
ManusManus AI通用 Agent

Google 白皮书三组件架构 (2024)

根据 Google AI Agent 白皮书,Agent 架构包含三个核心组件:

  1. 模型 (Model): 核心决策者,支持 ReAct、Chain-of-Thought、Tree-of-Thoughts 等推理框架
  2. 工具 (Tool): 连接外部世界的桥梁,三种类型:
    • Extensions: Agent 端执行,直接调用 API
    • Functions: 客户端执行,更精细的控制
    • Data Stores: 向量数据库,实现 RAG
  3. 编排层 (Orchestration): 认知架构核心,负责记忆、状态、推理和规划 — 本质是”规划 — 执行 — 调整”的循环

关键技术标准

  • MCP (Model Context Protocol):工具集成标准,与 Google Extensions 概念高度一致
  • A2A (Agent-to-Agent):Agent 通信标准
  • Harness Engineering:Agent 优化方法论
  • Agent Chaining / Mixture of Agent Experts: 组合多个专业化 Agent 的战略方向 (Google 白皮书提出)

相关资源

标签

ai agent autonomy tool-use

[2026-07-17] Agent 信息层栈成型 + Skill 工业化实证

  • 信息层栈三层已在本批次开源项目中清晰分层:① 接入层 Agent-Reach(50.7k 星,MIT CLI 脚手架,打通 Reddit/X/小红书/B 站/公众号,Cookie 认证绕 API 成本 0 vs 官方 200/月);② 过滤/打分层 last30days(4.6 万星 skill,并行扒多平台按真人互动量打分,v3 先认人认圈子再搜);③ 存储/检索层 OpenViking(2.6 万星,文件系统范式 + L0/L1/L2 分层 + 检索轨迹可视化)。
  • 呼应本页 Google 白皮书三组件中 Tool 层(Extensions / Functions / Data Stores)的工业化分工——三层并非同类竞品,而是 Agent 感知→记忆栈的不同层:接入获取原始信号、过滤打分提炼价值、存储分层按需检索。
  • Skill 工业化实证:sansheng-write(公众号写作流水线,19 脚本/12000+ 行/227 测试/7 质量门/状态机可恢复/verify 读像素验收)+ apple-design(17 条 WWDC 设计原则蒸馏,可中断性/材质层级/字体字距判断力框架)+ last30days(版本号/回归测试/质量评测)——Skill 正从”攒提示词加脚本”演进为工程化软件。
  • 乐高式组合 + 日抛软件:sansheng-write 整合 baoyu-skills/gzh-design-skill/MiniMax/Gemini 各仓独立迭代,作者论断”Agent 时代软件正变日抛型,模型三个月一换代”——呼应 AI-Agent-Development 中罗福莉”模型是消耗品,框架是资产”论断。

来源:../sources/2026-07-17-AI-Agent开源工具生态