Agent Harness(智能体框架/脚手架)
Agent Harness 是把 LLM 变成可靠 Agent 的运行时基础设施层——介于”模型”与”可用系统”之间。核心论点(Agent Harness 综述):模型能力相同时,harness 工程质量决定 Agent 的实际表现。
五组件模型
综述将 harness 抽象为五大组件:
| 组件 | 职责 | Claude Code 对应实现 |
|---|---|---|
| 规划器 | 任务分解、子目标 | Plan Mode、Initializer Agent |
| 记忆 | 短期工作记忆 + 长期持久化 | CLAUDE.md / MEMORY.md / Session Memory / 压缩 |
| 工具接口 | 函数调用 / MCP | tools 参数、tool search 延迟加载 |
| 编排器 | 单/多智能体调度 | 主循环、subagents、Dynamic Workflows |
| 评测反馈环 | trace + judge + 回归 | hooks、OpenTelemetry/Langfuse |
框架架构对比
| 框架 | 风格 | 适用 |
|---|---|---|
| LangGraph | 图状态机,显式控制流 | 需要精确控制的复杂流程 |
| AutoGen | 会话式多智能体 | 多 Agent 对话协作 |
| CrewAI | 角色分工 | 团队化任务分配 |
| OpenAI Swarm / Agents SDK | 轻量 handoff | 简单路由交接 |
| Anthropic(Claude Code) | 极简主循环 + 工具 | 低层次、无偏见的纯 Agent 运行时 |
选型取决于任务的可分解性与控制需求(设计模式分析)。
上下文工程:核心难点
上下文窗口管理(压缩、检索、缓存)直接决定长任务成败。Claude Code 的 prompt caching / compact 机制是成熟实现——参见 Claude Code 的 Prompt Caching 七条铁律。综述与 Production-Grade Harness 都强调:上下文工程是 harness 的第一难点。
可观测性即基础设施
- trace 是调试与评测的前提:记录每步 observation / reasoning / tool call / tool result / error / retry / token / latency / cost。
- 成本可观测性:OpenTelemetry / Langfuse 把成本/延迟纳入一等公民;prompt caching 显著降本。
- 评测闭环(AgentOps):harness 应内建评测反馈环,把生产 trace 回流为回归测试——开发/发布/线上监控一体化。
生产级批量 Harness(Claude Code 实例)
Production-Grade Harness 给出把 Claude Code 改造为批量评测基础设施的完整路径:claude -p 无头 + Agent SDK query() → hooks(exit 2 杠杆)→ initializer + coding-agent 长任务架构 → subagents 并行隔离 → OpenTelemetry/Langfuse 成本观测。
工程纪律基础
Python 工程路线图 提醒:harness 本质是高质量工程——类型安全、asyncio 并发、profiling、CI/CD、可观测性的系统化掌握,是构建可靠 harness 的底层能力。
矛盾或新想法
? Harness 该不该默认提供多智能体原语,仍是开放问题:综述把多智能体编排列为 harness 标准能力,但 实用指南 与 Cognition 主张单 Agent 优先。详见 Multi-Agent-Systems。
[2026-08-10] HarnessOpt-Bench:harness 优化能力首次成为评测对象
来源:评测日报 08-09。Scale AI 发布(arXiv 2608.06301),测”optimizer LLM 能否自动改好目标 agent 的 harness”:
- 协议:候选方案在全程不可见的 held-out 分区打分,TEE 强制隔离、计量资源消耗、保留版本供审计——可防”在评测集上过拟合 prompt”。
- 规模:4 任务 × 5 前沿模型,共 111 次计分运行。
- 三结论:optimizer 模型间差距 > 编码 harness 间差距(选”谁来优化 harness”比选 harness 模板更重要);原生 harness 并非稳定优于统一 harness;增益随任务与种子起点大幅波动。
这是”harness 本身成为评测对象”的首个系统基准,与本主题”harness 决定 agent 能力上限”的论点直接衔接。
[2026-08-10] Floatboat HLR:给”Harness 杠杆”定价
来源:Floatboat Harness 首次计量五项基准全胜(机器之心 2026-08-08,AOE Tech Labs 自报数据)。
- HLR(Harness Leverage Ratio)= 换 Harness 的分数增量 ÷ 升级到参照模型的公开分数跨度;>1 即”只换 Harness 的增量超过整段模型升级跨度”。
- DeepSWE 实例:同一 DeepSeek-V4-Flash 底座,官方 Harness 54.4 → Opus 4.8 公开 58.0(跨度 3.6 分);换 Floatboat Harness 得 67.25(增量 12.85 分),HLR = 3.57×。
- 五项 HLR 序列 0.78×→1.14×→1.32×→1.62×→3.57×,与程长同向(Harness 增量 1.9%→23.6% 单调递增无例外)——短程考模型单次输出质量,长程考整个执行系统。
- 规则先定、不许择优:Terminal Bench 上 Opus 4.8 与基线打平(82.7:82.7),按事先声明规则兜底取最便宜有效参照,并公开全部候选参照区间 0.26×–1.42×。
- 保留意见:全部数据为厂商自报、尚无第三方复算;HLR 为新提出指标而非行业标准,换参照系统数值会变。采信时保持”可复算但未被复算”状态。
- 与 Endpoint Accuracy 同向:模型权重之外的工程层(Harness / 推理链路)已被证实是独立的评测变量。
[2026-08-10] PTC 的”苦涩教训”:让更强的模型直接写代码
来源:评测日报 08-10。程序化工具调用(Programmatic Tool Calling,带类型 Python stub、模型写代码调用)vs 原生 JSON tool calling,BFCL v4 上 14 模型系统对比(arXiv 2608.06370):
- 11/14 模型追平或胜出,GPT-5.6 系列提升 10.6%;并行 fan-out 场景 13/14 追平或胜出;context rot 条件下 PTC 保持稳定而基线平均降 2.3%。
- 收益与模型能力正相关、随代际递增——不必给工具调用做复杂结构化约束,让更强的模型直接写代码。对 harness 工具接口层设计的直接启示。