Agent 可信执行三层栈:可学习、可约束、可追责
核心判断
长程 Agent 的可信性不能由一个“更聪明模型”或一个“更安全沙箱”单独提供。2026-08-11 批次的三类项目恰好组成互补层:Prime Agent 负责可学习,OpenSandbox 负责可约束执行,Semantica 负责可追溯决策。评测体系横跨三层,判断系统是否真的改善。
| 层 | 核心问题 | 代表机制 | 单独使用的盲点 |
|---|---|---|---|
| 学习/自治层 | Agent 如何从任务中变好? | /refine、记忆/Skill、快照回滚 | 可能学会错误经验或奖励黑客 |
| 执行/安全层 | 允许它对真实系统做什么? | 沙箱、Egress Policy、凭据代理、短生命周期 | 隔离了动作,不保证决策正确 |
| 决策/审计层 | 为什么这样做、依据来自哪里? | Context Graph、Provenance、规则/先例、墓碑 | 记录完整不等于推理真实或实现成熟 |
闭环
任务与政策
→ Agent 规划/执行
→ Sandbox 限制资源、网络和凭据
→ Trace + Context Graph 记录事实、规则、动作和结果
→ 外部 Eval 判断质量、可靠性、安全与成本
→ 通过验证的经验才进入 Memory / Skill
→ 版本化、灰度、可回滚三条设计原则
- 学习状态不能越过权限边界:Agent 可以学习“怎么做”,不能通过记忆或 Skill 提高自己可访问的资源级别。
- 审计记录必须覆盖结果状态:只有文本解释不够,还要记录工具调用、环境最终状态、凭据使用和规则版本。
- 验证器独立于被优化目标:自我反思可以提出改进,但是否合并必须由外部测试、业务 Rubric 或人类审批决定。
对评测的要求
KDD 综述提示评测目标至少覆盖行为、能力、可靠性与安全;08-11 日报进一步表明 Harness 本身也可能成为攻击面。因此可信栈的 Eval 必须同时测:多次运行一致性、权限/出站策略、轨迹归因、审计完整性、成本与长程退化,而不能只看一次任务通过率。
结论
生产级 Agent 的最小安全单元不是“模型 + Prompt”,而是:可回滚的学习状态 + 强制执行边界 + 可查询的决策账本 + 独立持续评测。缺任一层,另外两层都容易制造虚假的安全感。