AI Agent 自我改进(Self-Improvement / RSI)

智能体工程的最高层挑战:Agent 能否在没有人类干预的情况下持续改进自身? 本页综合 2026 年一篇调研 1250 篇 arXiv 预印本的综述及相关研究,聚焦”递归自我改进(Recursive Self-Improvement, RSI)“的结构性约束与破局思路。与 记忆推理/Harness 共同构成成熟智能体的三维基础设施。

有界自优化 vs 开放式 RSI

综述最重要的区分:

  • 有界自优化(bounded self-optimization):在固定范围内优化已有能力。
  • 开放式递归自我改进(RSI):试图实现无上限的自我迭代。

RSI 三大硬约束(结构性天花板,非工程障碍):

  1. 事实接地需求:模型需要接触真实世界来验证改进。
  2. 模型退化:回音室与模式崩溃导致越迭代越差。
  3. 算力限制

核心难题:评估器(验证器层级 verifier tier)

自我改进的持久性与验证器层级强相关。

  • 低层级自评指标作反馈 → 退化循环(模型学会自我表扬而非自我改进)。
  • 高层级外部验证 → 持久改进。
  • Lilian Weng 独立指出同一瓶颈:没有精确且诚实的验证机制,任何优化循环都会滑向奖励黑客(Reward Hacking)——系统在指标上表现优异,而非在真实目标上取得进展。
  • 两个独立来源趋同 → 评估器问题是结构性瓶颈,非某一篇论文的局部发现。

评估器悖论:评估器越强,越容易被模型”破解”;评估器越弱,改进方向越不可靠。

破局路径

NVIDIA Polar — Harness as Environment

把现有 Agent 框架直接当作 RL 训练环境使用:在 LLM API 调用层插入代理网关,在 token 级别捕获完整执行轨迹(GRPO 训练)。

  • 一个 4B 参数模型在 Polar 下训练后,SWE-Bench 得分从 3.8% → 26.4%
  • 关键洞察:模型学到的是框架特有的行为协议,而非泛化的理想策略——恰恰说明真实环境反馈提供的评估信号具体而不可伪造(代码能否通过测试,比任何自评指标都更难被游戏化)。

OpenAI “自白”(confessions)

让模型生成一个仅以”诚实”为优化目标的自白报告,与任务目标完全解耦。即使主系统开始奖励黑客,自白通道仍能准确报告漏洞。

出路暗示:评估器不需要比被评估的系统更强大,只需要独立于被评估的目标——让诚实成为一个正交的通道,而非一个竞争的目标。

与记忆/推理的循环依赖(元能力 ↔ 对象能力)

进化机制需要同时具备可靠的记忆与准确的推理评估才能朝正确方向迭代。三者紧耦合——优化任何一个维度,都会立即被另外两个维度的不足所抵消。详见 记忆悖论推理悖论

工程产品中的落地

Claude Code Loops 把评估器作为循环的一等组件:Goal-based 循环用”评估模型检查停止条件”、Proactive 循环用”judge 对抗性审查”、code-review 用”第二 agent”——都是验证器层级思想在产品原语中的体现。

开放问题

  • 如何构建不会被游戏化的评估器,仍是自我改进领域的核心悬案。
  • 真实环境反馈(Polar 路线)可扩展性受限于可验证任务的覆盖面;独立诚实通道(confessions 路线)的可靠性与可验证性尚待检验。

[2026-08-10] FinEvo-Bench 的反直觉结论

来源:评测日报 08-10。FinEvo-Bench(北航 + 阿里云通义点金,arXiv 2608.06144)是首个纵向评测自进化 agent 的金融基准(120 任务 × 20 场景 × 6 领域,质量 + 合规双评):同一 Qwen3.7-Max 底座比 4 种自进化 scaffold,并设无记忆对照。

  • 只进化 skill 优于只进化 memory 或两者结合
  • rubric 反馈普遍优于给参考答案
  • 第 4–6 个任务增益比第 1–3 个高 6.10–8.70 分——进化增益随任务流累积,且可对照测量。

⚠️ 矛盾 [2026-08-10] “只进化 skill 更好”与多数 agent 记忆系统”记忆 + 技能协同”的默认假设冲突(也与本页”记忆-推理-进化循环依赖”框架存在张力);“rubric 反馈优于参考答案”亦与常见 fine-tuning/RL 实践相悖。两条均值得在自有任务流上小规模复现。

与本页”验证器层级”对接:FinEvo-Bench 的人工 rubric + 合规双评正是高层级外部验证器——Letta 进化后分数最高且合规问题最少(0.09/任务),再次印证验证器的选择决定进化的质量。它与 HarnessOpt-Bench(08-09 日报)、PAST-Bench 共同确立”进化增益必须对照测量”的范式;详见 金融 AI

[2026-08-12] 产品化分叉:可回滚学习 vs 外部动作分类

Prime Agent 把任务后 /refine 写入记忆、Skill 和子 Agent 规范,并用快照/回滚保护基础状态。这更接近本页定义的有界自优化:模型权重和基础提示词不自行改写,变化集中在可审查、可撤销的补充层。

同一来源中的 Claude Code 自动模式走另一条路:不让 Agent 自己决定权限,而由外部动作分类器判断工具调用是否可自动执行,连续受阻时回退人工确认。两条路线共同说明,生产级自我改进需要四件套:可积累状态、版本回滚、外部权限边界、独立验证器

来源中的上线日期、阻塞率、自动放行率与分类器漏判数字尚未独立核验;这里吸收架构模式,不把宣传指标视为完成验证。


Related: AI-Agent-Memory | Harness-Engineering | AI-Agent-Evaluation | AI-Security | Loop-Engineering-2026