主要来源arXiv cs.AI
查看原文事件专题 · 多源确认
ActiveVision新基准:GPT-5.5和Claude Fable 5主动观察得分不足11%
多模态大模型(MLLM)在主动观察任务上能力缺失。新基准ActiveVision包含17个任务(3个类别),要求模型反复视觉感知而非单次描述。GPT-5.5在最高推理档次上仅解决10.6%的项,11个任务得零分;Claude Fable 5仅3.5%,而三名人类被试平均96.1%。即使让模型编写并运行自己的视觉代码,大部分差距依然存在,因为代码在真实图像上不可靠,且捕捉自身失败需要模型缺乏的主动感知。结果表明当前MLLM缺乏稳健的主动视觉观察能力。
当前结论
想看最强的AI在实时观察任务上有多弱吗?ActiveVision让GPT-5.5和Claude Fable 5原形毕露,人类碾压它们。
11 个信源34° AI 热度最后更新 2026/7/17 17:46:23
证据链
相关来源 1Decoder
查看原文相关来源 2lmarena.ai
查看原文相关来源 3Aravind Srinivas
查看原文相关来源 4shao__meng
查看原文相关来源 5Fireworks AI
查看原文相关来源 6Viking
查看原文相关来源 7Amjad Masad
查看原文相关来源 8orange.ai
查看原文相关来源 9AI Will
查看原文相关来源 10Jerry Liu
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。