AI 可解释性
AI 可解释性(Interpretability)研究如何让模型的内部表征与决策过程对人类透明可理解。随着模型能力增强,内部计算的黑箱化成为安全与信任的瓶颈,催生了机械可解释性、电路分析与探测(probing)等技术路线。它与 Agent 记忆、推理演进构成”三重悖论”——越能记忆和推理的系统,往往越难被人类审视。
AI 可解释性(Interpretability)研究如何让模型的内部表征与决策过程对人类透明可理解。随着模型能力增强,内部计算的黑箱化成为安全与信任的瓶颈,催生了机械可解释性、电路分析与探测(probing)等技术路线。它与 Agent 记忆、推理演进构成”三重悖论”——越能记忆和推理的系统,往往越难被人类审视。