这篇论文给VLM配了三种看图工具(表格、图表、放大),再用GRPO训练工具使用策略,比普通prompt和RL方法更准,适合处理科学图表验证。
#VLM
腾讯新出的具身模型 Hy-Embodied-VLM-1.0,只用 A3B 参数量就接近 A32B 的效果,37 个任务平均 65.6 分,还开源了。搞具身智能的朋友可以试试。
这篇论文用新数据集CSB系统地测了十年间视觉语言模型的进化,发现最新模型在复杂社交场景上已经跟人类顶级描述差不多准了,只有空间依赖错误还没完全解决。
想验证AI解释的可信度?ConceptSMILE能审计概念级解释的可靠性,MedSAM和VLM在不同维度各有优劣,论文给出了量化证据。
这篇论文把VLM做图像编辑时定位不准的老问题挖到底了——原来不是模型不行,是提取信号的方式错了。他们用了个'代理分析'的巧招,把隐藏的定位信号给揪了出来,搞编辑管线的值得一看。
Cortex把长程操作拆成32个标准动作,用开放数据自动训练,比纯VLA模型在Libero和RoboTwin上高3-4%,还能零样本做化学实验。
想看看现在的VLM在专业视频场景下有多拉胯?这篇论文搞了个AnyGroundBench基准,测了15个模型在动物、手术等5个领域的表现,结果全翻车了。
这篇论文发现直接用余弦相似度搞局部共形预测效果一般,但换个非线性变换后,预测集变小了,值得做VLM不确定性量化的看看。
这篇论文搞了个Argus基准,比较了27种不确定性方法在4个VLM模型和4个GUI数据集上的表现。结论很实在:方法排名换模型就不灵了,闭源还得单独测。做智能体部署的可以看看。
SPOT-E这个新方法挺有意思,它不重训模型,只在推理时搞了个视觉聚光灯和熵整形,就让VLM在那些需要细看局部证据的任务上表现好多了。尤其用GRPO调优,效果提升还挺稳定。
想少想多做?K2.7 Code 编码专用,推理开销比 K2.6 低三成,还能对标 GPT-5.5,适合写代码时不用纠结。
想知道微调后的机器人模型到底还记不记得常识?这篇论文用动作答题的方式测了7个VLA,发现简单概念还行,复杂知识掉得厉害。
机器人操作中失败尝试常被忽略,但本文证明它们才是关键线索——做具身智能或机器人规划的团队,可以用蒸馏出的单行提示直接提升VLM的轨迹理解能力,值得在仿真和真实场景中试试。
做文档解析或 RAG 系统的开发者终于有了一个贴近真实业务场景的评估工具——ParseBench 用 2000 页企业文档测试 VLM 的语义理解能力,比现有基准更贴近实际需求,值得关注并尝试。
做文档解析、RAG 或 AI Agent 的团队终于有了一个靠谱的评测标准——ParseBench 覆盖了企业文档的真实痛点,建议直接拿去测你的模型或产品。
工业需求工程师和RE工具开发者终于有了一个无需训练就能提升流程图转换精度的方案——EdgeFlow用边缘图做结构先验,直接让VLM的拓扑识别能力跃升,做模型驱动测试的团队值得一试。
具身智能研究者终于有了一个统一框架——Pelican-Unified 1.0 用一个模型搞定理解、推理、想象和行动,不再需要拼凑三个独立系统。做机器人、仿真或多模态模型的团队值得关注,它证明了统一不意味着妥协。