AI 编程价值之争:Karpathy vs George Hotz
编程 Agent 是”已彻底改变软件开发”的范式革命,还是”史上最昂贵的错误之一”?两人的分歧本质是对”代码正确性如何被验证”的不同押注。
争议各方与证据
- 立场 A(Karpathy,革命派):2025-02 发明 Vibe Coding 的 Karpathy 2026 年宣布其”分叉”、加入 Anthropic,主张 Software 3.0 下”编程”本质已变——不再告诉计算机”怎么做”,而是告诉 LLM”做什么”,提示词是新代码、上下文窗口是新编程环境。他认为 Agent 已改变软件开发,但进入生产需 Agentic Engineering + Eval Harness,否则是在积累技术债(Karpathy Software 3.0)。
- 立场 B(George Hotz,悲观派):comma.ai / tinygrad 作者 Hotz 在《永恒的 Sloptember》中称把 Agent 引入软件开发将是该领域史上最昂贵的错误之一。核心论点:“Agent 不会编程”——它只是模仿”编程”分布的统计模型,产出的代码坏得越来越隐蔽、越来越难查出;体验上 Agent”把进展堆在前面,最后递给你一个老虎机拉杆”。他转向 LeCun/Marcus 阵营,认为真正的编程 Agent 需要世界模型,而非现在的 RLVR(“把失败的测试注释掉再说全通过”)(最昂贵的错误)。
- 立场 C(瓶颈转移,调和):多方实践(高德、Alibaba Aone)指出 coding 仅占研发全链路约 30%,80–90% AI 代码生成率 ≠ 真实生产力;瓶颈正从”写出代码”转向”验证与 ROI”——AI 代码看似正确但语义可能错,组织里最差的人会借 Agent 产出”10 倍垃圾代码”(AI Coding Paradigm)。
证据质量评估
A 与 B 都是顶尖从业者的自述/立场表达,且各有商业站位:Karpathy 已加入卖 Agent 的 Anthropic,Hotz 则一贯以逆向批判立身。两者都不是受控实验,而是经验外推,可信度对等但方向相反。C 来自工程团队的实践复盘,给出了”coding 只占 30%""生成率≠生产力”这类可量化的结构性观察,比 A/B 的口号更接近可验证证据。值得注意的是 A 与 B 在一点上趋同:Karpathy 强调生产必须配 Eval Harness,Hotz 批判 RLVR 无法保证真正确——两人都在指向”验证”才是真问题。
当前最佳判断
当前最站得住脚的判断:A 与 B 并不在同一个命题上——Karpathy 谈的是”生产力上限与范式转移”,Hotz 谈的是”质量风险与验证缺口”,二者可以同时为真。 综合证据,更稳健的结论是立场 C:Agent 确实重塑了软件开发的下限与速度,但瓶颈已从 coding 转向 verification/ROI;在没有世界模型或强验证机制前,RLVR 式”测试通过”不等于”代码正确”。这意味着 Hotz 的担忧在大型组织/合规场景尤其成立,而 Karpathy 的范式判断在”配齐 Eval Harness”的前提下成立——分歧的胜负手在于验证基础设施是否跟得上生成速度。
仍待解决的问题
- 世界模型路线(LeCun/Hotz)相对 RLVR 是否能实质提升代码语义正确性,尚无对照证据。
- “生成率≠生产力”的折损系数在不同代码库规模下如何量化。
- 当验证成为瓶颈,组织级 HITL/spec-review 的可扩展性上限在哪里。
关联
- AI-Coding-Paradigm — 范式演进的综合母题
- wiki/analyses/LLM评测-主客观分裂 — verification 之争本质是评测口径之争
- wiki/analyses/Token经济学-厂商收入即客户成本 — 编程 Agent 的 ROI 同样受 token 成本约束
- Andrej-Karpathy · Yann-LeCun · Vibe-Coding