AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

视觉工具使用

共 1 条相关 AI 资讯
8月7日
13:28
13:28官方账号arXiv cs.AI@Zhiheng Wang, Bo Peng, Lai Wei, Chaochao Lu
论文提出视觉证据增益(Visual Evidence Gain)估计量,在策略、轨迹、步骤三个层级干预,审计多模态大模型的裁剪缩放等视觉工具调用。对 6 个代表性模型和 5 个细粒度感知基准的测试显示,工具调用相对直接推理的准确率提升有限,甚至为负,而 token 成本明显更高。作者识别出两种失败模式:Calling Without Looking 中返回的观察对答案无因果作用,Looking Without Planning 中观察有信息量但调用次序不合理。轨迹级诊断表明,策略级准确率增益集中在少数校准良好的轨迹上,作者称之为视觉工具使用的幻觉。代码已在 GitHub 的 OpenCausaLab/CauAudit 发布。
论文多模态视觉工具使用因果审计

推荐理由:这篇论文查了6个模型的视觉工具调用:多数只是白花钱,只有少数轨迹真有用。别被表面准确率骗了。
原文
精选全部日报登录