7月3日
10:01
10:01官方账号arXiv cs.AI@Rintaro Otsubo, Ryo Fujii, Reina Ishikawa, Taiki Kanaya, Kanta Sawafuji, Hiroki Kajita, Shigeki Sakai, Hideo Saito, Ryo Hachiuma
AnyGroundBench是一个域适应基准测试,将时空视频定位评估从静态零样本测试转向严格的域适应。它覆盖动物、工业、运动、手术和公共安全五个专业领域,提供新拍摄视频(如专家标注的小鼠行为)与现有数据集配对,并配备密集的高保真时空标注。评估了15个SOTA视觉语言模型(VLM)的零样本泛化和上下文学习(ICL)能力。结果表明,当前模型在专业领域上的零样本和基于ICL的适应均失败,暴露出时空推理的关键缺陷。
推荐理由:想看看现在的VLM在专业视频场景下有多拉胯?这篇论文搞了个AnyGroundBench基准,测了15个模型在动物、手术等5个领域的表现,结果全翻车了。
09:59
09:59官方账号arXiv cs.AI@Xiangchen Cheng, Yunwei Jiang, Jianwen Sun, Zizhen Li, Chuanhao Li, Xiangcheng Cao, Yihao Liu, Fanrui Zhang, Li Jin, Kaipeng Zhang
AgenticSTS提出了一种有界记忆合同,通过类型化检索为每个决策组装新提示,避免跨决策原始记录累计。在Slay the Spire 2游戏中,前沿LLM在不同配置下最低难度胜率为0%,而人类开发者报告胜率为16%。固定A0消融实验中,无记忆基线获胜3/10局,添加策略技能层后获胜6/10局,但差异统计不显著(Fisher精确p≈0.37)。研究发布了298条完整轨迹、冻结记忆/技能快照、提示记录和分析脚本的可重复测试平台。
推荐理由:AgenticSTS用Slay the Spire 2游戏测试LLM智能体记忆:无记忆胜率3/10,加技能6/10,人类16%。做长时域智能体研究可以参考这个方法论。
09:57
09:57官方账号arXiv cs.AI@A. Seza Doğruöz, Xixian Liao, Verena Blaschke, Jakob Prange, Senyu Li, David Ifeoluwa Adelani
该论文分析了ACL Anthology中650篇提及LLM-as-a-Judge的论文,发现仅33篇关注低资源或多语言场景。研究发现存在不一致的评价结果、对LLM判断过度信任以及普遍依赖单一评判模型的问题。作者基于分析提出了针对多语言和低资源环境下使用LLM-as-a-Judge的具体建议。
推荐理由:这篇论文很实在,直接指出LLM-as-a-Judge在多语言场景下不靠谱,只找出33篇相关研究还一堆问题。做NLP评估的朋友建议看看。
09:55
09:55官方账号arXiv cs.AI@Mohammed Fahad Ali, Dominique Briechle, Marit Briechle-Mathiszig, Tobias Geger, Andreas Rausch
该研究比较了One-Vs-All和One-Vs-Rest两种分类策略在德国戈斯拉尔市垃圾分类数据集上的表现,数据集包含该市特定的垃圾分类方案。通过设置不同置信度阈值,识别可能误分类的样本并引入人工审核,旨在平衡误分类率与人工标注成本。实验结果表明,OvR策略在较低阈值下能更有效地减少误分类。该工作为定制化AI垃圾分类应用提供了参考。
推荐理由:这篇论文用德国戈斯拉尔的真实垃圾分类数据,比较了OvA和OvR两种策略,还加入了人工检查的环节,减少误分类的同时控制成本,挺实用的。
09:45
09:45官方一手arXiv: DeepSeek@Zirui Chen, Zhipeng Xue, Jiayuan Zhou, Xing Hu, Xin Xia, Xiaohu Yang
Refploit是一个基于LLM的轨迹恢复框架,用于从公开漏洞利用参考中重现漏洞利用。它通过差异化执行验证智能体生成的漏洞利用,当无效时分析重现进度、定位轨迹片段并推导约束以指导恢复。在三个开源Java漏洞数据集(172个漏洞引用,143个漏洞)上,使用DeepSeek-V4-Flash时,Refploit成功重现138个漏洞利用,重现率达80.2%。相比初始轨迹提升64.3%,超过现有方法PoCGen及基于GPT-5.4的Codex等高级代码智能体。
事件专题

推荐理由:Refploit能自动修复代码智能体生成漏洞利用时出错的部分,用DeepSeek-V4-Flash在143个Java漏洞上做到80.2%成功率,比PoCGen和GPT-5.4驱动的Codex都强。搞漏洞研究的人可以关注。
09:40
09:40官方账号arXiv cs.AI@Gemma Galdon Clavell, Pablo Accuosto, Usman Gohar
该论文指出至少74种现有AI风险分类法几乎都止步于风险目录,缺乏实操。Eticas AI Risk Taxonomy v2.0.0 提出从概念到可衡量发现的桥梁,涵盖10个类别、20个子组、76个活跃子类别,并映射到18个外部框架。以GPT-4-0314上的PII泄露风险为例,在对抗性条件增强下披露率从0%升至84%,对应SYSTEMIC模式E级评分。分类法和子组以CC BY 4.0开源发布,提供稳定URI和SKOS/JSON-LD分发。
推荐理由:这篇论文真正解决了AI审计“光列风险但不教你怎么测”的痛点,用GPT-4实测PII泄露,给了一个可复现的评分样例。分类法开源了,想搞审计的可以直接用。
09:36
09:36官方账号arXiv cs.AI@Javier Irigoyen, Roberto Daza, Aythami Morales, Julian Fierrez, Ruben Tolosana, Ruben Vera-Rodriguez, Francisco Jurado, Alvaro Ortigosa
这篇论文基于欧盟AI Act等新兴监管框架,分析了AI系统风险评估与管理的需求。它梳理了从技术故障到伦理社会影响的风险谱系,并评述了多种AI风险识别与分析的方法论。论文还指出了当前方法论中的最佳实践与研究空白,为后续研究提供了方向。
推荐理由:想了解AI风险评估的学术框架?这篇综述覆盖了AI Act等监管背景,适合研究者快速掌握现状。
09:23
09:23官方账号arXiv cs.LG@Max Weltevrede, Matthijs T. J. Spaan, Wendelin Böhmer
论文证明在上下文MDP中,过度悲观不会阻碍最优泛化,但必须尊重最优解的对称性。通过理论分析,适度悲观但非对称的值函数可能比过度悲观且对称的值函数泛化更差。数据增强应通过在策略提取时施加一致性损失来提升泛化,而非在增强数据集上常规训练。使用IQL和CQL在旋转对称reacher环境中验证了该方法。
推荐理由:这篇论文用理论和实验告诉你,离线RL里悲观多少不重要,悲观的结构对不对才关键,还给出了数据增强的正确用法。
09:19
09:19官方账号arXiv cs.LG@Zhanming Shen, Jintao Tong, Shaotian Yan, Chen Shen, Hao Chen, Wentao Ye, Xiaomeng Hu, Rui Miao, Haobo Wang, Junbo Zhao, Gang Chen, Jieping Ye
研究发现在线自蒸馏(OPSD)在长思维链推理模型上效果有限且破坏推理稳定性。通过分解教师监督信号,发现参考导致的成分驱动死记硬背,而可迁移的问题条件成分被忽略。提出两步解法:首先构建仅参考教师以隔离不可迁移成分,再用点互信息(PMI)过滤掉参考捷径。在4个长思维链模型和2个数据集上,该方法相比基线和标准OPSD均取得一致改进。
推荐理由:这篇论文解决了OPSD在长推理模型上越蒸馏越笨的问题,用PMI过滤器保留思考能力,值得做推理优化的朋友看看。
09:04
09:04官方账号arXiv cs.LG@Samiha A. Ismail, Fan X. Chen, Ali Merali
研究者设计了5个临床场景(麻醉、内科/家庭医学、急诊、产科),共184条MECE评分标准。GPT 5.4、Claude Opus 4.7、Gemini 3.1 Pro的平均rubric通过率分别为0.39、0.47、0.37。最关键的权重5标准通过率仅32.4-41.7%,而低权重(1)标准通过率80-90%。108个关键标准中52%未被任何模型满足。LLM自动评分器在92.8-94.7%的标注上再现专家判断。
推荐理由:这篇论文告诉你当前最强模型在临床推理上有多弱:关键问题正确率不到一半,而简单问题却能答得很准。适合想了解模型真实局限的读者。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。