推理模型(Reasoning Models)

概念页:在回答前进行扩展链式思考(chain-of-thought)的 LLM,通过测试时算力换取更高推理质量。本页为 stub。

核心定义

推理模型指在生成最终回答前,先进行长链内部思考(chain-of-thought / 隐式推理)的大语言模型。其核心权衡是用**测试时算力(test-time compute)**换取更高的复杂推理正确率,常配合 RLVR(强化学习带可验证奖励)训练。代表:OpenAI o1/o3 系列、DeepSeek-R1、Anthropic Extended Thinking 等。

工程观察

  • “推理档位”本质上是一句提示词:Codex/Claude Code 推理档位分析 指出所谓”低/中/高推理”档位在工程实现上往往就是一句系统提示,而非模型本身的开关。

⚠️ 矛盾 [2026-08-03]:“推理档位=一句提示词”的工程观察,与厂商营销中”推理模型是新模型/新能力”的叙事存在张力——部分”推理”是训练时获得的能力,部分是推理时提示与算力调配的结果,两者口径需分清。

关联