AOE Tech Labs

Floatboat 的开发商。创始人拥有 10 年 OS + AI 创业与亿级用户产品经验,两位技术合伙人分别为模型训练与 OS 底层背景。在行业普遍基于 Claude Agent SDK 套壳时,坚持全栈自研,并首次公开对 Harness 本身进行量化计量。

全栈自研四层 + 演化系统

  • Runtime:决定 Agent 能碰到什么(DeepSWE 平均改 7 个文件、新增 668 行;AutomationBench 要在 47 个 SaaS、近 500 个 API 端点间穿行);
  • Agent Loop:决定长程任务能否收敛;
  • Tools:决定结果能否被正确消费(“把失败包装成空字符串的工具会让模型在第 15 步做出自信的错误决策”);
  • Infra:决定失败能否被发现;
  • FloatSail:演化系统。

论断:“四层里任意一层是别人的,上限就是别人的上限。

HLR 指标

提出 HLR(Harness Leverage Ratio,换 Harness 的收益 ÷ 换模型的收益)——首个试图给”Harness 杠杆”定价的公开指标;>1 即”只换 Harness 的增量超过整段模型升级跨度”。配套”规则先定、不许择优”的参照声明方法(公开全部候选参照区间)。详见 Harness Engineering

产品谱系

时间产品定位
2026-01FloatboatAgent 桌面工作台
2026-04FloatIM人-Agent / Agent-Agent 办公网络
2026-05FloatSchedule按日程自主开工
FloatSail演化系统

关键事件(2026-08-07/08)

以五项第三方 Agent 基准(DeepSWE、Terminal Bench 2.1、Toolathlon、BrowseComp、AutomationBench)公开完整评测:最便宜底座 DeepSeek-V4-Flash(混合价 0.175/M)+ Floatboat Harness 五项全胜,全部超过贵 57.1 倍的 Claude Opus 4.8(10/M);同底座 Harness 增量按程长单调递增 1.9% → 23.6%。商业侧推出 DeepSeek 专版首月 5 元/1 美金。详见 源页LLM 价格战

⚠️ 矛盾 [2026-08-10] 五项全胜数据与”贵旗舰 = 强 Agent”叙事冲突;但全部数据为厂商自报、尚无第三方复现,HLR 为新提出指标而非行业标准(换参照系统数值会变)。采信时保持”可复算但未被复算”状态。

关联