Token 经济学:厂商收入即客户成本

Token 经济深处埋着一条结构性张力——模型厂商每多赚一块钱,就是某家公司的账单多一块钱。这条张力是理解定价、补贴与降本工程之间关系的总钥匙。

争议各方与证据

  • 立场 A(厂商天花板叙事):Anthropic 2026-05 完成 65B H 轮、估值 965B、年化营收突破 $47B(约等于可口可乐全年营收),超 1000 家企业年付超百万美元,被推测可能成为首个年收入万亿美元的公司(万亿美元公司)。
  • 立场 B(客户成本崩塌):Uber 头四个月即花完全年 $3.4B(34 亿美元) AI 预算被迫限用;微软因费用超标放弃 Claude Code、改用自家托管的 OpenAI 模型;一个程序员放开用旗舰模型一年 token 费可达数千万到上亿人民币(周刊 No398)。
  • 立场 C(补贴换习惯):SemiAnalysis 压力测试显示 200/月 Claude Max 20x 按 API 价折算约值 8,000(约 40× 补贴)、200/月 ChatGPT Pro 20x 约值 14,000(约 70× 补贴)——本质是补贴换重度用户与开发者习惯(200 美元订阅薅出 1.4 万美元)。
  • 立场 D(省 token 工程):前缀缓存(prefix caching)、精简冗余 skill 减少每轮注入上下文,是补贴退坡后被倒逼出的客户端降本工程(Token 经济)。

证据质量评估

A 为厂商融资叙事 + 媒体推测,“万亿美元”是作者大胆猜测而非可验证预测,需大幅打折。B 为从业者自述/媒体报道(阮一峰周刊、Peter Steinberger 案例),具体数字(Uber 34 亿、微软弃用)属二手转述、未审计,但方向上多方印证。C 的 SemiAnalysis 压力测试方法相对透明、可复算,是四者中可信度最高的量化证据。D 为工程共识,方向可靠但具体省费幅度因负载而异。整体看,B 与 C 的”成本压力真实存在”证据权重最高,A 的天花板叙事最弱。

当前最佳判断

当前最站得住脚的结论:Token 需求的价格弹性在组织层面很低、在总账层面很高——单个工程师放开用收益巨大,但聚合到公司预算必然触顶。 因此厂商短期必然以补贴(40–70×)换习惯,而一旦退坡,省 token 工程(缓存、上下文精简、小模型路由)会从”优化项”变为”生存项”。Anthropic 的 $47B 营收与 Uber 的预算崩塌是同一枚硬币的两面:厂商收入的每一分都对应客户的成本决策,这条张力会持续压低无限量使用的空间。“厂商收入=客户成本”不是 bug,而是 Token 经济的基本恒等式。

仍待解决的问题

“首个万亿美元公司”是媒体推测,缺乏可验证路径;$47B 年化营收的可持续性依赖补贴是否退坡,二者互相矛盾。

  • 补贴退坡的时间表与幅度未知,直接决定省 token 工程的紧迫性。
  • 企业级 token 成本占研发总预算的比例缺乏行业基准。
  • 自托管/开源模型能否在质量可接受前提下实质降本,尚待规模化验证。

关联