10:36官方账号arXiv cs.AI@Yu Chen, Ting Lei, Yaoyi Li, Jia Cai, Zhecen Wu, Yang LiuRuleMaze是一个可控基准,要求MLLMs在迷宫中遵守自然语言规则。通过自动生成自然语言规则并将其转换为逻辑表示,RuleMaze消除了手动规则工程的需要。Disentangled Multimodal Planning (DMP)通过可解释的推理原语分离感知、执行和规则验证,提高了规则遵循和泛化能力。实验表明,DMP在规则遵循和规划成功率方面显著优于端到端文本规划基线。论文RuleMazeMLLMsDMP推荐理由:RuleMaze提出了一个创新的基准,通过DMP技术显著提升了MLLMs的规则遵循能力,对于研究MLLMs的空间规划具有重要意义。原文稍后读已读值得跟进有用关注 RuleMaze
10:55官方账号arXiv cs.AI@Feixiang Liu, Qiang Qiu, Lanbo Sun, Nan Wei, Huawei Shen, Xueqi ChengVCA方法通过分离文本和空白对照,评估多模态大模型(MLLMs)在空间基准中是否真的依赖图像证据。在四个MLLMs和两个基准上,12.73-26.25%的正确决策未获得图像信用。相同分割的图像排列使依赖正确性下降21.25-47.80点,所有95%置信区间均高于零。固定像素关系对比和3x3证据源阶乘设计表明,空对照无法识别关系响应;在受控正确但未获信用的决策中,关系反转响应覆盖81.57-100.00%,32.11%改变答案。论文VCA多模态空间推理MLLMs推荐理由:这篇论文告诉你,模型答对空间题不一定是因为看了图——VCA方法能揪出这种虚假正确。结果发现十几到二十几个百分点的正确回答其实没用到图像信息。原文稍后读已读值得跟进有用关注 VCA
11:01官方账号arXiv cs.AI@Yu-Yang Chen, Lan-Zhe GuoTriViewBench 是一个基于合成3D场景的受控多视图视觉推理基准,包含1,923个场景和超过14K个问答对,分为4个复杂度级别和3个推理类别:局部决策、物体计数和全局恢复。评估18个开源和闭源MLLMs发现,所有模型能力排序一致(局部决策>物体计数>全局恢复),且随着复杂度增加性能单调下降:局部决策下降12.11%,物体计数下降59.14%,全局恢复骤降80.02%。错误分析表明,单视图任务中因遮挡导致欠计数,多视图任务因跨视角身份混淆导致过计数。Chain-of-Thought提示几乎无收益(Δ=-0.16%),表明瓶颈在于跨视角空间表示而非推理策略。论文TriViewBenchMLLMs多模态推荐理由:这篇论文用TriViewBench测了18个多模态模型,发现它们都在多视图推理上崩得厉害,CoT也救不了。想了解当前MLLM的结构推理极限,可以看看。原文稍后读已读值得跟进有用关注 TriViewBench
12:36官方一手arXiv: OpenAI@Cong Han, Xiaohan Lan, Haibo Qiu, Yujie ZhongAIR方法通过扩展强化学习训练,使MLLMs具备自适应交错推理能力,专门处理代码增强的复杂数值计算任务。该方法包含两阶段冷启动数据构建、强化学习数据集筛选策略,以及基于群约束奖励函数的自适应工具调用策略。在评测基准上,平均性能提升6.1个百分点,其中交错推理样本准确率提高9.9个百分点,工具调用成功率超过95%。论文代码和数据集已开源。论文AIRMLLMsOpenAI o3推荐理由:这篇论文让MLLMs学会用代码做数值推理,准确率涨了6个点,工具调用成功率超95%,代码开源可复现。原文稍后读已读值得跟进有用关注 AIR