8月13日
17:48
17:48官方账号arXiv cs.AI@Zile Zhou, Huining Yuan, Weichen Zhang, Xinlei Chen, Xiao-ping Zhang
SCOUT 提出结构化思维链框架,显式建模 3D 环境感知以增强空间理解。其强化学习算法引入多目标过程奖励和定制的优势估计方法,实现推理轨迹的细粒度信用分配。研究者构建了 SCOUT-24k 结构化空间推理数据集。SCOUT-3B 在通用空间基准上提升 16.85%,在复杂空间推理任务上提升 6.3%。SCOUT-7B 超出 GPT-4o 4.28%,且能泛化到多图像和视频场景。
推荐理由:空间推理一直是视觉语言模型的硬伤,SCOUT 用新的训练方法把 3D 理解做得更准,7B 规模直接超过 GPT-4o,还能迁移到视频上。
8月12日
8月11日
22:04
22:04LlamaIndex@llama_index
精选
LlamaIndex应用研究团队推出ExtractBench,号称最全面的企业复杂文档信息抽取基准。该基准测试了14个系统,包括前沿VLM、编程智能体和抽取API,覆盖370份企业文档、4869页和67种文档类型。评测完全确定性,不使用LLM作为裁判。最大发现是超过50页后,商业VLM的召回率跌破35%,精度虽高但会静默丢失大部分表格行。
事件专题

推荐理由:做文档抽取的团队看过来,LlamaIndex 出了个新基准,测了14个系统在370份企业文档上的表现,发现超过50页商业模型召回率就崩了,赶紧看看你的抽取方案中招没。
7月28日
10:35
10:35官方账号arXiv cs.AI@Wenxuan Zhang, Yuhui Wang, Donggang Jia, Xiaoqian Shen, Jian Ding, Ivan Viola, Jürgen Schmidhuber, Mohamed Elhoseiny
HyGAE是一种针对视觉-语言模型(VLM)智能体的强化学习框架,提出混合优势估计(Hybrid Advantage)和统一评价器(Unified Critic),同时优化令牌级和回合级目标。在五个多回合决策环境中的评估显示,HyGAE的平均成功率达到91%,相比其他方法提升了10%。理论分析表明,混合优势和回报的精确解析形式对优化至关重要。
推荐理由:这篇论文提出了HyGAE方法,让VLM智能体在多个回合的决策任务里表现更好,平均成功率91%,比别的方法高了10%,值得搞强化学习和多模态的研究者看看。
7月26日
16:12
16:12官方一手pandaily@contact@pandaily.com (Pandaily)
腾讯 Robotics X 在 WAIC 2026 上开源三个具身基础模型:VLM 负责场景理解,RxBrain 认知模型基于视觉状态进行规划,VLA 连续动作控制频率达 500-1000Hz。首席科学家张正友解释了三层大脑架构,解决了机器人反应速度问题。这些模型分别对应感知、认知和动作层,可组合用于复杂操作任务。

推荐理由:腾讯开源了三个具身模型,像搭积木一样分层解决机器人从看懂到动起来的难题,VLA 能做到毫秒级反应,做机器人开发的一定要看看。
7月21日
12:33
12:33官方账号arXiv cs.AI@Yi Tang, Xinyi Shang, Jiacheng Cui, Sondos Mahmoud Bsharat, Jiacheng Liu, Xiaohan Zhao, Tran Dinh Tien, Ahmed Elhagry, Salwa K. Al Khatib, Tianjun Yao, Yonina C. Eldar, Jing-Hao Xue, Hao Li, Salman Khan, Zhiqiang Shen
本研究针对ChatGPT、Gemini、Qwen-Image等现代VLM的像素级图像篡改检测,提出简单域泛化训练框架,包含平衡小批量采样和后期注入策略。在OOD VLM(GPT-Images-2.0、Gemini-3.1、FLUX.2、Seedream 4.5)上,该方法相比先前最优PIXAR,平均gIoU和cIoU分别相对提升26.1%和26.8%。代码已开源于GitHub。
推荐理由:他们用两个简单技巧,让检测AI改图的模型在GPT、Gemini等新模型上比之前最好的PIXAR强了26%多,代码也开源了,搞图像安全的可以试试。
12:09
12:09官方账号arXiv cs.LG@Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann, Jun-Yan Zhu, Eli Shechtman, Alexei A. Efros, Richard Zhang
本文提出TPIPS,一种基于文本提示的图像感知相似度度量,能根据文本条件区分形状、颜色等不同视觉相似性维度。研究基于大规模三元组数据集,包含多种自由形式语义相似性标注。在多个前沿视觉语言模型(VLM)基准测试中,模型与人类一致性差距显著。通过微调VLM,TPIPS在文本引导检索、组合搜索和生成模型细粒度评估中表现更优,且泛化良好。
推荐理由:这篇论文搞了个新度量TPIPS,能按文字指令判断两张图在哪个方面像,比现有单标量打分更细。数据集和模型都开源了。
7月13日
10:50
10:50官方账号arXiv cs.AI@Shravan Murlidaran, Miguel P. Eckstein
论文引入Complex Social Behavior (CSB)数据集,包含100张复杂社交场景图片。研究评估了2017-2025年间4个pre-MLLM和5个MLLM模型在CSB和MS-COCO上的表现,并与20个人类描述对比。分析了物体检测、识别、幻觉、场景理解和空间依赖五种错误类型。MLLM在CSB上的场景描述准确率与人类顶级描述相当,几乎消除了所有错误类型,但偶尔仍存在空间依赖误差。
推荐理由:这篇论文用新数据集CSB系统地测了十年间视觉语言模型的进化,发现最新模型在复杂社交场景上已经跟人类顶级描述差不多准了,只有空间依赖错误还没完全解决。
7月8日
10:17
10:17官方账号arXiv cs.AI@Yoav Baron, Sara Dorfman, Roni Paiss, Daniel Cohen-Or, Or Patashnik
本文研究VLM在扩散图像编辑管线中作为条件编码器时的定位能力下降问题。作者提出Analysis-by-Proxy框架,训练轻量级代理模型在VLM中间表示上执行辅助定位任务。实验发现,在单次前向传递约束下,定位信号未可靠传播到预设条件层配置,而是隐藏在随输入提示变化的中间表示中。该框架揭示了现有编辑管线条件提取策略的根本失败,为设计更合理的条件架构提供了方向。
推荐理由:这篇论文把VLM做图像编辑时定位不准的老问题挖到底了——原来不是模型不行,是提取信号的方式错了。他们用了个'代理分析'的巧招,把隐藏的定位信号给揪了出来,搞编辑管线的值得一看。
7月7日
11:36
11:36官方账号arXiv cs.AI@Jiaqi Peng, Xiqian Yu, Delin Feng, Yuqiang Yang, Wenzhe Cai, Jing Xiong, Ganlin Yang, Jinliang Zheng, Jiafei Cao, Xueyuan Wei, Jiangmiao Pang, Yuan Shen, Tai Wang
Cortex是一个双向对齐的体现代理框架,通过将操作子任务标准化为32个规范技能原语,并结合可执行性约束(如对象属性和轨迹可达性)自动标注4000+小时开源视频数据并生成30小时模拟数据。在Libero-long和RoboTwin基准上,Cortex分别比单一VLA模型提升3.1%和4.1%。其通用VLM与微调VLA结合,能零样本完成未见过的真实世界长程任务(如多阶段化学实验),而这单靠VLA微调无法实现。
推荐理由:Cortex把长程操作拆成32个标准动作,用开放数据自动训练,比纯VLA模型在Libero和RoboTwin上高3-4%,还能零样本做化学实验。
7月3日
10:01
10:01官方账号arXiv cs.AI@Rintaro Otsubo, Ryo Fujii, Reina Ishikawa, Taiki Kanaya, Kanta Sawafuji, Hiroki Kajita, Shigeki Sakai, Hideo Saito, Ryo Hachiuma
AnyGroundBench是一个域适应基准测试,将时空视频定位评估从静态零样本测试转向严格的域适应。它覆盖动物、工业、运动、手术和公共安全五个专业领域,提供新拍摄视频(如专家标注的小鼠行为)与现有数据集配对,并配备密集的高保真时空标注。评估了15个SOTA视觉语言模型(VLM)的零样本泛化和上下文学习(ICL)能力。结果表明,当前模型在专业领域上的零样本和基于ICL的适应均失败,暴露出时空推理的关键缺陷。
推荐理由:想看看现在的VLM在专业视频场景下有多拉胯?这篇论文搞了个AnyGroundBench基准,测了15个模型在动物、手术等5个领域的表现,结果全翻车了。
6月30日
13:46
13:46官方账号arXiv cs.AI@Xinlei Yu, Gen Li, Qingyi Si, Guibin Zhang, Yuqi Xu, Congcong Wang, Shuai Dong, Kaiwen Tuo, Xiangyu Zeng, Kaituo Feng, Qunzhong Wang, Yang Shi, Xiaobin Hu, Xiangyu Yue, Jiaqi Wang, Shuicheng Yan
精选
DOPD是一种advantage-aware的双重蒸馏范式,通过动态路由令牌级监督信号,在特权教师和特权学生策略之间进行分配,缓解了传统同策略蒸馏中的特权幻觉问题。实验在LLM(如GPT-2)和VLM(如CLIP)上验证,结果显示DOPD在稳定性和鲁棒性等指标上持续优于Vanilla OPD。
推荐理由:这篇论文提出了一种新蒸馏方法DOPD,通过分令牌监督解决特权幻觉,在LLM和VLM上效果都更好,适合关注模型压缩的研究者。
6月25日
09:32
09:32官方账号arXiv cs.AI@Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi
Argus基准系统评估了4个VLM智能体和4个数据集上27种开箱不确定性量化方法,以及3个闭源供应商的8种方法。主要发现是UQ排名在固定模型下跨数据集稳定(Spearman rho最高0.969),但跨模型类和接口时衰减。隐状态和密度法在开箱族中最稳定,而CoCoA-1MCA、Focus等方法在特定场景胜出。闭源UQ需在目标上重新排序,平均转移相关性仅+0.08。校准后局部加权盘半径缩小40-60%,但校准-测试不匹配时覆盖度下降。
推荐理由:这篇论文搞了个Argus基准,比较了27种不确定性方法在4个VLM模型和4个GUI数据集上的表现。结论很实在:方法排名换模型就不灵了,闭源还得单独测。做智能体部署的可以看看。
6月19日
10:10
10:10官方账号arXiv cs.AI@Bo Yin, Xiaobin Hu, Chengming Xu, Ruolin Shen, Mo Yang, Jiangning Zhang, Peng-Tao Jiang, Cheng Tan, Shuicheng YAN
SPOT-E方法针对视觉语言模型在处理证据密集型任务时因小区域视觉证据被忽略导致的读取失败问题。该方法利用答案跨度预测熵作为模型内部反馈,通过低熵锚点和熵整形目标消除歧义,避免模型陷入捷径塌缩。SPOT-E基于GRPO进行每实例轻量级调优,生成问题条件化的聚光灯。在多个VLM族和基准测试中,SPOT-E一致提升了性能并增强了视觉损坏鲁棒性。代码已开源。
推荐理由:SPOT-E这个新方法挺有意思,它不重训模型,只在推理时搞了个视觉聚光灯和熵整形,就让VLM在那些需要细看局部证据的任务上表现好多了。尤其用GRPO调优,效果提升还挺稳定。
6月18日
10:57
10:57官方账号arXiv cs.LG@Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin, Nikita Kurlaev, Daria Pugacheva, Albina Burlova, Mikhail Kolosov, Denis Shepelev, Andrey Kuznetsov, Elena Tutubalina, Aleksandr I. Panov, Alexey K. Kovalev, Vlad Shakhuro
论文提出 Act2Answer 协议,通过让智能体在桌面场景中执行物体放置动作来选择答案,从而在动作层面评估 7 个 VLA 模型和 9 个 VLM 基线在常识与知识任务上的表现。研究发现,VLA 在简单概念上表现扎实,但在丰富语义类别上相比源 VLM 出现更大差距。实验还表明,VQA 联合训练有助于提升知识保留,而答案相关信息在 VLA 中层达到峰值,上层则衰减。
推荐理由:想知道微调后的机器人模型到底还记不记得常识?这篇论文用动作答题的方式测了7个VLA,发现简单概念还行,复杂知识掉得厉害。
6月11日
11:28
11:28官方账号arXiv cs.AI@Jadelynn Dao, Milan Ganai, Yasmina Abukhadra, Ajay Sridhar, Mozhgan Nasr Azadani, Katie Luo, Clark Barrett, Jiajun Wu, Chelsea Finn, Marco Pavone
精选72°
DIRECT 是一个路由框架,利用多模态场景上下文为每个提示分配测试时计算资源,以改善成功-成本帕累托前沿。研究发现,在链式思维深度、模型大小和记忆历史三个缩放轴上,测试时计算并非均匀杠杆,不同轴带来不同能力增益。在 VLABench 和 RoboMME 上的实验表明,DIRECT 在物理 Franka 机械臂上匹配或超越更强模型的成功率,同时平均延迟降低高达 65%。该工作揭示了朴素缩放测试时计算的浪费性,为具身代理的部署提供了更高效的方案。
推荐理由:DIRECT 解决了具身规划中测试时计算资源浪费的问题,做机器人部署和 VLM 应用的团队可以直接参考其路由策略,在降低成本的同时保持性能。