长程 Agent 任务

长程 Agent 任务(long-horizon agentic work)指需要数小时无人值守、自主完成的端到端多步骤任务,是衡量大模型真实可用性的高难度考验。这类任务要求模型在长上下文窗口内保持连贯推理、准确识别执行边界(不替用户做决定、不重写既有架构)、并能从”装都装不上”推进到”能装、能跑、能演示”。GLM-5.2 在此类任务上的表现使其成为新”御三家”中首个中国模型。

2026-08-10

定量证据:Harness 增益随任务程长单调递增 — 来自 Floatboat Harness 首次计量AOE Tech Labs 自报数据,2026-08-08):

  • 同一 DeepSeek-V4-Flash 底座、只换 Harness,五项第三方基准的分数增量按任务程长从短到长排列:1.9% → 9.6% → 12.6% → 19.9% → 23.6%,单调递增无例外。短程任务考模型单次输出质量,长程任务考整个执行系统(Agent Loop、工具、上下文管理、可观测性);而真实工作(跨文件、跨应用、多步、中途改主意)恰好都是长程任务。
  • 失败机制分解:长程失败通常不是”某一步答错”,而是循环没有收敛——① 交付标准模糊(关键标准第一句话里不存在,人的意图随中间产物逐渐清晰);② 模型逐轮漂移(概率生成的微小偏移在逐轮自引用中累积成方向性错误,“每一步看起来都合理,合起来却不是要交付的东西”)。
  • 含义:任务越长程,越需要把投入放在”收敛机制”上——显式交付标准、每轮对齐目标锚点、可验证停止条件。参见 Harness EngineeringLoop Engineering 2026

数据为厂商自报、尚无第三方复现,采信时保持”可复算但未被复算”状态。

实践侧呼应Codex 七天 230 亿 Token 50 条经验 从重度用户侧给出同一方向的操作法——让 AI 持续搜索/分析/执行/验证几小时几天推进一个目标;目标写结果不写动作(不说”研究一下竞品”,要说”交付竞品数据库、差异分析和可执行方案”);复杂任务先用 Plan 模式拆步骤、找风险、定验收标准再执行。

关联