03:20官方账号NVIDIA AI@NVIDIAAINVIDIA Research发布空间推理诊断基准Spatial-IQ,将3D物体计数拆分为九项感知与认知子任务。人类在该基准上计数准确率为82.1%,而最好的现成多模态模型仅达17.7%。针对子任务训练后,Qwen2.5-VL-32B的计数准确率从2.9%提升到62.6%。该基准可帮助研究者定位空间推理失败点并验证能力改进。AI模型NVIDIASpatial-IQQwen2.5-VL1 个信源在谈事件专题推荐理由:NVIDIA搞了个Spatial-IQ基准,把数箱子拆成九个子任务,Qwen2.5-VL练完后准确率从2.9%飙到62.6%,但离人类82.1%还远。原文稍后读已读值得跟进有用关注 NVIDIA