8月25日
10:55
10:55官方账号arXiv cs.AI@Md Thamed Bin Zaman Chowdhury, Moazzem Hossain
针对低资源国家道路交通事故问题,提出EGD框架,将道路安全专家知识转化为视觉语言模型,实现可扩展的道路安全审计。BD-ARSA数据集包含21,947条图像审计记录,EG-ARSA模型在风险评估上优于其教师模型和Gemini-2.5-Flash模型。
推荐理由:EG-ARSA模型基于专家知识,有效解决低资源环境下的道路安全审计问题,是Gemini-2.5-Flash模型的升级版。
8月24日
8月10日
11:08
11:08官方账号arXiv cs.AI@Bhavika Jalli, Nikhil Korati Prasanna, Jayanta Choudhury
论文提出用视觉语言模型处理数值时间序列,将KPI窗口编码为2D图,在Llama-3.2-90B、Qwen2.5-VL-72B和Pixtral-12B上实现3.6-10.4倍输入token缩减。实测推理能耗降低1.8-2.5倍,在电信边缘部署中每天节省约7.2MJ。微调的Llama-3.2-90B-Vision异常检测精度比文本版高220.7%,比LSTM和ARIMA高144%。Pixtral-12B在公共基准上J/F1提升20.6倍,平均F1为0.82。
推荐理由:这篇论文告诉你,把数据画成图再给模型看,能省电还更准。电信场景实测能耗降2.5倍,精度翻倍,值得做时序分析的人看看。
8月5日
11:41
11:41官方账号arXiv cs.AI@Mercy Prasanna Ranjit, Anirban Porya, Sathvik Joel, Niharika Vadlamudi, Nikhilesh Chowdary Eathamukkala, Prasanth V, Abhyuday Kumara Swamy, Pranay Narhari Umredkar, Pradeep Narayan, Vivek Rajagopal, Tanuja Ganu
CARE-X 在生成骨干网络上增加焦损失分类与复合损失定位头,与语言建模目标联合训练,使胸片报告生成、发现分类和空间定位互相增强。配合任务级奖励优化的 DAPO 策略,该方法在四个报告生成基准的大部分指标上达到最优,ReXVQA 视觉问答准确率 94.0%,比次优基线高 6.0 个百分点。此外,将 Qwen3-VL-4B-Instruct 与可调用确定性测量工具的原生工具能力结合,在五个依赖测量的诊断场景中平均 F1 比仅靠感知的基线高 43.6 个百分点。
推荐理由:医学影像领域的小伙伴可以看看这篇,CARE-X 把胸片分类、定位、报告生成整合到一个模型里,还靠工具调用做解剖测量,临床实用性比纯生成模型强不少。
8月4日
09:30
09:30官方账号arXiv cs.AI@Timothee Mickus, Claudio Savelli, Eduardo Calò, Emilio Raimond, Stella Frank, Hengyu Luo, Flavio Giobergia, Vincent Segonne, Chuyuan Li, Aman Sinha, Lorenzo Vaiani, Jörg Tiedemann, Raúl Vázquez
该研究构建了包含1,600个人类编写的幻觉样本数据集,覆盖中、英、法、意四种语言,并同时收集了来自五个视觉语言模型的18,400个样本进行对比。所有样本采用细粒度的跨度级标注方案来标记幻觉。实验发现,人类编写的样本在标注一致性上更高,且便于控制数据集内容,同时与模型生成样本在分布上保持相似。这表明人类数据可以替代模型生成的幻觉基准,用于更稳定的模型幻觉评估。
推荐理由:这篇论文用1,600个人类写的幻觉样本对比了18,400个模型生成的样本,发现人类样本更稳定、更好控制,以后测幻觉不用老换模型了。
7月27日
11:56
11:56官方账号arXiv cs.AI@Yifei Zhao, Xiangxin Zhou, Wenhao Yang, Jiaqi Tang, Pu Jian, Huanjin Yao, Jiarui Yao, Haowei Lin, Chunchao Guo, Zhuo Chen, Wenkai Lyu, Jianzhu Ma, Xueqian Wang, Wenxi Zhu
SceneActBench 是一个评估视觉语言模型(VLM)代理在3D场景中行动能力的基准,包含5个任务,覆盖210个源实例和520个任务案例。每个任务在统一的代理-环境循环中运行,使用任务特定的几何指标评估最终输出。在11个专有VLM配置上测试,总体得分范围为38.6到50.2,没有任何配置在所有任务上表现一致。论文分析了失败模式,指出当前模型在多对象3D场景中的行动能力仍有显著不足。
推荐理由:想测测视觉语言模型能不能真在3D空间里干活?SceneActBench给你5个任务、520个案例,开源又公平,看哪个模型分高。
7月22日
12:27
12:27官方账号arXiv cs.AI@Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin
PathAgentBench评估视觉语言模型在整张病理切片上的四种能力:跨模态匹配、区域定位、多尺度推理。基准包含1822张TCGA整张切片和17135条诊断路径。在20个模型中,开源模型在多尺度推理上达到93%准确率,但诊断区域定位的IoU低于0.09。自主探索时高倍放大下命中率仅0.020,表明从WSI获取证据仍具挑战。
推荐理由:想测试病理AI能不能像医生一样在超大图片里找病灶?这个基准专门考这个,结果发现定位能力还很弱。
7月9日
09:16
09:16官方账号arXiv cs.AI@Ricardo Maia Avelino, Rita Sevastjanova, Tom Van Mele, Philippe Block, Mennatallah El-Assady
该论文指出,当前追求消除摩擦的生成式AI(如通用对话模型)与结构设计师通过迭代摩擦激发创意的需求存在错位。研究者提出一个基于视觉语言模型的协同设计系统,使结构探索变得对话式、多模态,并能响应用户的演化意图。通过一个原型界面和与领域专家的研究,发现该系统能减少重复性建模摩擦,同时保留有益于创意生成的反思维摩擦。
推荐理由:这篇研究说AI一味追求“省事”反而帮倒忙——结构设计需要“摩擦”来激发灵感。他们用视觉语言模型做了个交互系统,帮设计师边想边改,保留思考摩擦,去掉重复劳动。
09:08
09:08官方一手arXiv: OpenAI@Xin Li, Jiaju Han, Ma Yaqi, Chengyin Hu, Yingying Zhao, Jiahuan Long, Fengyu Zhang, Yahui Chai
精选
InfraQR 是一种针对红外视觉语言模型的攻击方法,将紧凑结构化补丁沿图像边界放置,通过代理 CLIP 编码器优化可学习网格单元。在 300 张红外图像基准上,InfraQR 将 OpenAI CLIP 的分类准确率从 98.67% 降至 0.70%。攻击还迁移到黑盒字幕和 VQA 模型,导致字幕语义退化,并在 GPT-5.4 评估下产生更易错的答案。结果表明红外视觉语言模型易受边缘结构化扰动影响,需进一步研究跨任务鲁棒性。
事件专题

推荐理由:这篇研究告诉你,红外视觉语言模型有多脆弱——一个 QR 风格的边角补丁就能让 OpenAI CLIP 准确率从 98.67% 跌到 0.70%,还能黑盒攻击其它模型。搞安全或对抗训练的值得一看。
7月8日
6月23日
12:53
10:53
10:53官方账号arXiv cs.AI@Yundaichuan Zhan, Minghe Gao, Zhongqi Yue, Wendong Bu, Wenqiao Zhang, Guoming Wang, Jisheng Dang, Juncheng Li, Siliang Tang, Yueting Zhuang
SCOPE 提出一种自适应的符号规划框架,由 Symbolic Execution Simulator(SESim)和 Self-Adaptive Symbolic Memory(SASMem)两个模块协同工作。SESim 通过符号验证和实际执行反馈来 refine 行动计划和进化符号世界;SASMem 则将反馈蒸馏为可演化的符号知识。在开放环境实验中,SCOPE 使符号世界完整性提升,在环境扰动下计划成功率提高,并增强了跨任务泛化能力。
推荐理由:搞机器人规划的朋友可以看看 SCOPE,它用符号执行加记忆更新解决开放世界符号不完整的老问题。
6月16日
13:08
13:08官方账号arXiv cs.AI@Jiaju Han, Ben Zhang, Xuemeng Sun, Qike Zhang, Yuxian Dong, Chengyin Hu, Fengyu Zhang, Yiwei Wei, Jiujiang Guo
FusionRS是用于遥感双模态视觉语言学习的首个大规模RGB-红外-文本数据集。它由超过100万对对齐的RGB和红外风格图像组成,每对包含场景描述和红外感知描述。基于FusionRS训练的CLIP-style和生成式VLM模型在RGB-红外对齐、红外-文本检索和双模态描述任务上均优于纯RGB训练基线。消融实验表明,红外感知描述对强化红外-语言对齐至关重要。
推荐理由:FusionRS填补了RGB-红外双模态遥感数据集的空白,用公开RGB图转红外风格,加上两种描述,让模型同时理解可见光和红外信息。
6月10日
6月8日
6月4日
12:49
12:49Fireworks AI@FireworksAI_HQ
精选72°
Step 3.7 Flash 是阶跃星辰(StepFun)发布的 198B 稀疏 MoE 视觉语言模型,专为推理效率从头设计。该模型包含 196B 语言骨干和 1.8B 视觉编码器,支持原生多模态理解和行动,可靠工具使用,以及增强的网页和视觉搜索。在真实智能体工作负载下,推理速度可达 400 tok/sec,并采用 Apache 2.0 开源许可。Fireworks AI 已提供在线试用。
事件专题

推荐理由:多数实验室事后才考虑推理效率,而 Step 3.7 Flash 从设计之初就为推理优化,做智能体应用和视觉语言模型的开发者可以直接试用,感受 400 tok/sec 的流畅体验。