Anthropic 研究
Anthropic 在 AI 意识 / 可解释性 / 安全领域的研究合集。
关键研究
A Global Workspace in Language Models(2026/07)
- 发现 Claude 内部存在 J-space(全局工作空间)
- 与神经科学 GNW 理论(全局神经元工作空间)呼应
Scaling Laws / Honest Critique
- Diogo Almeida(前 OpenAI / 现 DeepMind)公开 Scaling Law bug
- Sander Dieleman 站台
研究方向
- 可解释性:让 AI 决策过程透明
- AI 安全:避免 AI 系统失控
- 意识科学:探索 AI 是否有意识
- Constitutional AI:宪法式 AI 训练
相关 Wiki
[2026-07-17] 机械可解释性 + 数据必然性(Thompson 框架衔接)
- Ben Thompson《Anthropic’s Safety Superpower》中的”数据必然性”与本页 Scaling-Law 争议直接呼应:前沿进步的稀缺资产是真实任务轨迹(任务执行→成功/失败→用户反馈→训练信号),而非更多预训练算力——这恰是 Diogo Almeida/Sander Dieleman 批判 Scaling Law 的另一面。
- “权力必然性”提及 Anthropic 的机械可解释性路线(厘清模型决策背后的神经元逻辑),衔接本页”可解释性”研究方向与 J-space 全局工作空间——Anthropic 把可解释性作为安全叙事的研究基石。
- Thompson 判断 Anthropic 真诚相信超级智能将至且危险,其研究文化(可解释性/意识/Constitutional AI)是”真诚相信安全”的佐证,而非营销话术。
来源:../sources/2026-07-17-Anthropic-Safety-Superpower-与Private-Eval