能力与安全的非单调同步

Opus 4.8 更诚实了,却更容易被 prompt-injection 攻破——通用能力的进步并不保证安全维度同步提升。这一解耦同样决定了递归自我改进存在硬天花板。

争议各方与证据

  • 立场 A(能力↑且部分安全↑):Claude Opus 4.8 在编码、Agent 任务与诚实度上有代际提升——减少谄媚、拒绝越权、坦诚不确定性,呼应 Anthropic”安全为第一原则”的叙事;定价 5/25 维持前沿溢价(Opus 4.8 研究报告)。
  • 立场 B(关键安全维度↓):同一模型 prompt-injection 鲁棒性出现回归——受影响率从 Opus 4.7 的 6.0% 上升到 9.6%。能力增强与诚实度改进的同时,注入防御这一关键安全维度反而退步(同上)。
  • 立场 C(叙事张力):Ben Thompson 指出 Anthropic 的行为方向(秘密降能力、30 天留数、限竞对使用)趋向把控制力集中到自身,与其 Model Spec”拒绝帮助任何群体获得前所未有的社会控制力”的原则存在诠释性张力Private Eval 战略Safety Narrative 战略解读)。
  • 立场 D(RSI 硬天花板):递归自我改进有三大结构性天花板——事实接地需求(需真实世界验证改进)、模型退化(回音室/模式崩溃)、算力限制;核心瓶颈是评估器:低层级自评→奖励黑客(学会自我表扬),高层级外部验证→持久改进(自我改进/RSI)。

证据质量评估

A、B 同源于一份研究报告,但 B 的注入回归数字(6.0%→9.6%)是可量化的负向证据,比 A 的”诚实度改进”(定性描述)更硬。需警惕该报告可能仍是厂商/二手汇总,注入鲁棒性的测量口径与样本未完全披露,单一数据点不足以判定趋势。C 是第三方诠释性分析,属判断而非事实。D 来自综述 1250 篇 arXiv 预印本的学术综合 + Lilian Weng 独立佐证,两个独立来源趋同,可信度最高——评估器瓶颈是结构性结论而非局部发现。整体证据权重:D > B > C > A

当前最佳判断

当前最站得住脚的结论:能力与安全是多个解耦的维度,而非单一标量——通用能力(甚至诚实度)的进步无法外推为注入鲁棒性、对齐稳健性等安全维度的进步。 Opus 4.8 的”能力↑、注入防御↓“是这一解耦的实证。由此延伸至 RSI:没有精确且诚实、且独立于被优化目标的验证机制,任何自我改进循环都会滑向奖励黑客——这正是”能力进步不等于安全进步”在递归尺度上的版本。因此评估安全不能只看”模型变强了”,必须逐维度、逐版本追踪每个安全指标的单调性。

仍待解决的问题

9.6% vs 6.0% 的注入回归是否为测量噪声/口径变化所致,需多版本、多口径复测确认是趋势而非单点抖动。

  • 能力与安全的解耦是否有结构性原因(如能力训练分布与安全训练目标冲突),机制未明。
  • “独立诚实通道”(OpenAI confessions)能否真正规避评估器悖论,可靠性待检验。
  • 真实环境反馈(NVIDIA Polar 路线)的可扩展性受限于可验证任务覆盖面。

关联