OpenCausaLab
上海 AI Lab 旗下团队,把因果推断方法系统引入 AI 评测可信度审计,代表作为 CauAudit 三层因果干预审计协议。
CauAudit(arXiv 2608.06270)
来源:评测日报 08-10。把视觉工具调用建模为因果图,在 policy / trajectory / step 三层做干预;step 层以 Visual Evidence Gain 隔离每次观测的真实贡献。6 模型 × 5 感知 benchmark 发现两类失准:
- Calling Without Looking:工具返回的观测对答案毫无因果效应;
- Looking Without Planning:观测有信息但调用时机不连贯。
policy 层准确率增益集中在少数”Calibrated”轨迹上——聚合分数上涨,但工具调用在大多数 rollout 中不起作用。启示:现有 agent 工具调用 benchmark 的高分可能主要来自少数校准轨迹的聚合效应,评测报告应报告轨迹级归因而非仅聚合分数。代码开源(CauAudit)。
方法学意义
与同日摄入的 AI 评测因果推断归因分析(淘天技术) 同构——“因果干预审计”正成为评测可信度的通用诊断工具,可推广到检索、代码执行等非视觉工具;与 AI Agent Evaluation 的失败归因框架互补(前者诊断”工具是否真的起作用”,后者归因”哪个组件出了问题”)。