Agent Harness(智能体框架/脚手架)

Agent Harness 是把 LLM 变成可靠 Agent 的运行时基础设施层——介于”模型”与”可用系统”之间。核心论点(Agent Harness 综述):模型能力相同时,harness 工程质量决定 Agent 的实际表现。


五组件模型

综述将 harness 抽象为五大组件:

组件职责Claude Code 对应实现
规划器任务分解、子目标Plan Mode、Initializer Agent
记忆短期工作记忆 + 长期持久化CLAUDE.md / MEMORY.md / Session Memory / 压缩
工具接口函数调用 / MCPtools 参数、tool search 延迟加载
编排器单/多智能体调度主循环、subagents、Dynamic Workflows
评测反馈环trace + judge + 回归hooks、OpenTelemetry/Langfuse

框架架构对比

框架风格适用
LangGraph图状态机,显式控制流需要精确控制的复杂流程
AutoGen会话式多智能体多 Agent 对话协作
CrewAI角色分工团队化任务分配
OpenAI Swarm / Agents SDK轻量 handoff简单路由交接
Anthropic(Claude Code)极简主循环 + 工具低层次、无偏见的纯 Agent 运行时

选型取决于任务的可分解性与控制需求设计模式分析)。


上下文工程:核心难点

上下文窗口管理(压缩、检索、缓存)直接决定长任务成败。Claude Code 的 prompt caching / compact 机制是成熟实现——参见 Claude Code 的 Prompt Caching 七条铁律。综述与 Production-Grade Harness 都强调:上下文工程是 harness 的第一难点。


可观测性即基础设施

  • trace 是调试与评测的前提:记录每步 observation / reasoning / tool call / tool result / error / retry / token / latency / cost。
  • 成本可观测性:OpenTelemetry / Langfuse 把成本/延迟纳入一等公民;prompt caching 显著降本。
  • 评测闭环(AgentOps):harness 应内建评测反馈环,把生产 trace 回流为回归测试——开发/发布/线上监控一体化。

生产级批量 Harness(Claude Code 实例)

Production-Grade Harness 给出把 Claude Code 改造为批量评测基础设施的完整路径:claude -p 无头 + Agent SDK query() → hooks(exit 2 杠杆)→ initializer + coding-agent 长任务架构 → subagents 并行隔离 → OpenTelemetry/Langfuse 成本观测。


工程纪律基础

Python 工程路线图 提醒:harness 本质是高质量工程——类型安全、asyncio 并发、profiling、CI/CD、可观测性的系统化掌握,是构建可靠 harness 的底层能力。


矛盾或新想法

Harness 该不该默认提供多智能体原语,仍是开放问题:综述把多智能体编排列为 harness 标准能力,但 实用指南 与 Cognition 主张单 Agent 优先。详见 Multi-Agent-Systems


[2026-08-10] HarnessOpt-Bench:harness 优化能力首次成为评测对象

来源:评测日报 08-09Scale AI 发布(arXiv 2608.06301),测”optimizer LLM 能否自动改好目标 agent 的 harness”:

  • 协议:候选方案在全程不可见的 held-out 分区打分,TEE 强制隔离、计量资源消耗、保留版本供审计——可防”在评测集上过拟合 prompt”。
  • 规模:4 任务 × 5 前沿模型,共 111 次计分运行。
  • 三结论:optimizer 模型间差距 > 编码 harness 间差距(选”谁来优化 harness”比选 harness 模板更重要);原生 harness 并非稳定优于统一 harness;增益随任务与种子起点大幅波动。

这是”harness 本身成为评测对象”的首个系统基准,与本主题”harness 决定 agent 能力上限”的论点直接衔接。

[2026-08-10] Floatboat HLR:给”Harness 杠杆”定价

来源:Floatboat Harness 首次计量五项基准全胜(机器之心 2026-08-08,AOE Tech Labs 自报数据)。

  • HLR(Harness Leverage Ratio)= 换 Harness 的分数增量 ÷ 升级到参照模型的公开分数跨度;>1 即”只换 Harness 的增量超过整段模型升级跨度”。
  • DeepSWE 实例:同一 DeepSeek-V4-Flash 底座,官方 Harness 54.4 → Opus 4.8 公开 58.0(跨度 3.6 分);换 Floatboat Harness 得 67.25(增量 12.85 分),HLR = 3.57×
  • 五项 HLR 序列 0.78×→1.14×→1.32×→1.62×→3.57×,与程长同向(Harness 增量 1.9%→23.6% 单调递增无例外)——短程考模型单次输出质量,长程考整个执行系统。
  • 规则先定、不许择优:Terminal Bench 上 Opus 4.8 与基线打平(82.7:82.7),按事先声明规则兜底取最便宜有效参照,并公开全部候选参照区间 0.26×–1.42×。
  • 保留意见:全部数据为厂商自报、尚无第三方复算;HLR 为新提出指标而非行业标准,换参照系统数值会变。采信时保持”可复算但未被复算”状态。
  • Endpoint Accuracy 同向:模型权重之外的工程层(Harness / 推理链路)已被证实是独立的评测变量

[2026-08-10] PTC 的”苦涩教训”:让更强的模型直接写代码

来源:评测日报 08-10。程序化工具调用(Programmatic Tool Calling,带类型 Python stub、模型写代码调用)vs 原生 JSON tool calling,BFCL v4 上 14 模型系统对比(arXiv 2608.06370):

  • 11/14 模型追平或胜出,GPT-5.6 系列提升 10.6%;并行 fan-out 场景 13/14 追平或胜出;context rot 条件下 PTC 保持稳定而基线平均降 2.3%。
  • 收益与模型能力正相关、随代际递增——不必给工具调用做复杂结构化约束,让更强的模型直接写代码。对 harness 工具接口层设计的直接启示。