Anthropic 研究

Anthropic 在 AI 意识 / 可解释性 / 安全领域的研究合集。


关键研究

A Global Workspace in Language Models(2026/07)

  • 发现 Claude 内部存在 J-space(全局工作空间)
  • 与神经科学 GNW 理论(全局神经元工作空间)呼应

Scaling Laws / Honest Critique

  • Diogo Almeida(前 OpenAI / 现 DeepMind)公开 Scaling Law bug
  • Sander Dieleman 站台

研究方向

  • 可解释性:让 AI 决策过程透明
  • AI 安全:避免 AI 系统失控
  • 意识科学:探索 AI 是否有意识
  • Constitutional AI:宪法式 AI 训练

相关 Wiki

[2026-07-17] 机械可解释性 + 数据必然性(Thompson 框架衔接)

  • Ben Thompson《Anthropic’s Safety Superpower》中的”数据必然性”与本页 Scaling-Law 争议直接呼应:前沿进步的稀缺资产是真实任务轨迹(任务执行→成功/失败→用户反馈→训练信号),而非更多预训练算力——这恰是 Diogo Almeida/Sander Dieleman 批判 Scaling Law 的另一面。
  • “权力必然性”提及 Anthropic 的机械可解释性路线(厘清模型决策背后的神经元逻辑),衔接本页”可解释性”研究方向与 J-space 全局工作空间——Anthropic 把可解释性作为安全叙事的研究基石。
  • Thompson 判断 Anthropic 真诚相信超级智能将至且危险,其研究文化(可解释性/意识/Constitutional AI)是”真诚相信安全”的佐证,而非营销话术。

来源:../sources/2026-07-17-Anthropic-Safety-Superpower-与Private-Eval