13:28官方账号arXiv cs.AI@Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu论文提出视觉证据增益(Visual Evidence Gain)估计量,在策略、轨迹、步骤三个层级干预,审计多模态大模型的裁剪缩放等视觉工具调用。对 6 个代表性模型和 5 个细粒度感知基准的测试显示,工具调用相对直接推理的准确率提升有限,甚至为负,而 token 成本明显更高。作者识别出两种失败模式:Calling Without Looking 中返回的观察对答案无因果作用,Looking Without Planning 中观察有信息量但调用次序不合理。轨迹级诊断表明,策略级准确率增益集中在少数校准良好的轨迹上,作者称之为视觉工具使用的幻觉。代码已在 GitHub 的 OpenCausaLab/CauAudit 发布。论文多模态视觉工具使用因果审计推荐理由:这篇论文查了6个模型的视觉工具调用:多数只是白花钱,只有少数轨迹真有用。别被表面准确率骗了。原文稍后读已读值得跟进有用关注 多模态