7月7日
11:33
11:33官方账号arXiv cs.AI@Kaiyuan Chen, Shuangyu Xie, Letian Fu, Justin Yu, William Pacini, Sandeep Bajamahal, Hudson Kim, Jaimyn Drake, Daehwa Kim, Haoru Xue, Jonathan Francis, Christian Juette, Peter Schaldenbrand, Muhammet Yunus Seker, Ruwan Wickramarachchi, Uksang Yoo, Guanzhi Wang, Adithyavairavan Murali, Balakumar Sundaralingam, S. Shankar Sastry, Spencer Huang, Yuke Zhu, Linxi "Jim" Fan, Ken Goldberg
GaP(Graph-as-Policy)是一种多智能体编码框架,从模块化开放机器人技能库MORSL生成含感知、规划和控制节点的有向计算图。它构建内部仿真环境并行排练不同图结构的任务实例,迭代优化图结构与参数以提升成功率和吞吐量。在8个新开放VA任务基准(4个仿真、4个真实世界)上,GaP的成功率显著优于基线方法。论文、代码和数据已开源。
推荐理由:这篇论文提出GaP,把机器人编程的可靠性和模型无关策略的适应性结合起来,在8个变分自动化任务上吊打基线。做机器人任务规划的话值得一看。
11:30
11:30官方账号arXiv cs.AI@Thomas Thebaud, Yuzhe Wang, Hao Zhang, Sathvik Manikantan Napa Ugandhar, Ashish Hallur, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velazquez
SPEARBench基于Seamless Interaction语料库构建对话提示,评估多个当代语音到语音模型在响应延迟、中断、语音质量、ASR鲁棒性、语言与方言一致性、情感自然度、人际关系立场等8个维度上的表现。与人类对话相比,当前模型在延迟、重叠、方言保留、情感适应和立场动态方面仍有差距。基准包含原始人类回答作为参考条件。
推荐理由:想测语音AI聊天有多自然?SPEARBench从8个维度对比人类,告诉你现有模型的短板具体在哪。
11:15
11:15官方账号arXiv cs.AI@Anthony Hu, Václav Volhejn, Adrien Ramanana Rahary, Chris Mulder, Aditya Makkar, Amélie Royer, Manu Orsini, Alyx Liao, Adam Jelley, Eloi Alonso, Florian Laurent, Fredrik Norén, James Swingos, Jan Hünermann, Kent Rollins, Lucas Hosseini, Matthieu Le Cauchois, Maxim Peter, Pim de Witte, Tim Brown, Vincent Micheli, Moritz Böhle, Gabriel de Marmiesse, Viktoriia Sharmanska, Lucia Specia, Michael Black, Patrick Pérez
精选
该研究提出了首个多人世界模型,适用于Rocket League等动态物理环境。模型使用5B参数潜扩散架构,在单张Nvidia B200 GPU上以20fps实时生成4人比赛。训练数据为10,000小时游戏回放,模型在5分钟评估窗口内保持分布质量稳定,实际可稳定运行数小时。研究者系统分析了视频编解码器、生成目标和多人条件方案等设计选择。
事件专题

推荐理由:第一个能实时多人互动的世界模型,Rocket League里5B参数跑20fps,还开源了全部代码和数据,值得看看。
11:11
11:11官方账号arXiv cs.AI@Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian Sang, Xiaomin Li, Wenhui Zhu, Xinchen Du, Aida Rahmattalabi, Ran He, Sen Na, Zhipeng Wang, Alborz Geramifard
TREK提出一种分阶段训练方法,解决GRPO在困难提示上的探索停滞问题。该方法先用蒸馏将教师模型(如DeepSeek-V4)的已验证轨迹拉入学生模型支持域,再返回标准GRPO精炼。在数学推理中,TREK将Qwen3-8B在AIME 2025上从36.9提升至40.3,在AIME 2024上从47.9提升至51.1(avg@16)。在代理任务上,ALFWorld成功率从75.8提高到82.8,ScienceWorld从12.5提高到26.7。TREK的泛化优势在于仅需已验证输出轨迹,可兼容黑盒或白盒教师。
推荐理由:这篇论文给出了一个实用技巧:用蒸馏扩展支持域再强化学习,在数学和代理任务上都涨点明显,而且不需要改动模型结构。
11:07
11:07官方账号arXiv cs.AI@Zefeng Wang, Minxi Yan, Jinhe Bi, Sikuan Yan, Volker Tresp, Yunpu Ma
MetaSkill-Evolve提出双时间尺度框架,使智能体技能改进递归化:任务技能在快循环演化,元技能(分析、检索、分配、提议、进化五组件)在慢循环自我应用。在OfficeQA、SealQA和ALFWorld三个基准测试上,该方法相比无技能基线分别提升+23.54、+16.09和+1.92个点。所有组件共享单一冻结骨干模型,无需额外模型或目标。
推荐理由:这篇论文让AI智能体不仅能学技能,还能自动改进改进方法本身,在三个测试集上都有明显提升,挺有意思。
7月3日
12:01
12:01官方账号arXiv cs.LG@Zhuowei Chen, Liwei Chen, Christian Schunn, Raquel Coelho, Xiang Lorraine Li
NeuFS提出一种基于神经元激活模式的主动少样本学习框架,替代传统基于输出熵或语义相似性的样本选择方法。它在推理和文本分类两个任务共三个数据集上超越现有AFSL基线。消融实验证明内部神经元激活信号比外部嵌入在选择信号上更有效。该方法通过双标准策略兼顾样本多样性和模型易幻觉样本识别。
推荐理由:这篇论文把样本选择从看输出结果改成看神经元内部活动,比传统方法更精准,适合专门领域的少样本学习场景。
12:00
12:00官方账号arXiv cs.LG@Boyang Sun, Jiajie Li, Yung-Hsu Yang, Chenyangguang Zhang, Tim Engelbracht, Sunghwan Hong, Cesar Cadena, Marc Pollefeys, Hermann Blum
该论文提出了一个名为LIME的视觉语言相机运动生成器。它根据当前RGB图像和自然语言意图,预测下一视角的相对目标相机位姿(SE(3))。为了训练模型,作者从第一人称视频中挖掘多意图相机运动监督信号,配对合理的意图和观察增益描述。LIME结合了自回归的观察增益输出和连续流匹配位姿头,能够联合预测下一视图该展示什么并代表多假设目标视图。实验表明,LIME可从被动的人类视频中学习主动选择相机位姿,用于下游机器人任务。
推荐理由:这篇论文让你知道,给机器人一个语言指令,它就能自己学会怎么转动相机去看你想看的地方——全靠学人类第一人称视频,不用手动标数据。
11:57
11:57官方账号arXiv cs.LG@Thomas Winninger
论文提出RFM-AGOP方法,通过适应RFM算法和探针初始化,在数秒内从推理模型Qwen 3和非推理模型Qwen 2.5中提取多维拒绝子空间。该方法在消融任务上表现优于现有方法,且计算成本较低。研究为LLM安全对齐提供了高效可扩展的监控手段。
推荐理由:想低成本搞懂LLM拒绝行为?这篇论文用RFM-AGOP几秒就定位到多维子空间,比传统方法快还准。
11:49
11:49官方账号arXiv cs.AI@Yuxuan Li, Lingxi Xie, Xinyue Huo, Jihao Qiu, Jiacheng Shao, Pengfei Chen, Jiannan Ge, Kaiwen Duan, Qi Tian
研究者发布了DramaSR-532K基准,包含53.2万条带注释对话和900多个角色,需整合听觉、语言和视觉线索。他们提出DramaSR-LRM方法,基于大型推理模型(LRM),通过多模态工具自主聚合上下文证据。在短话语上,DramaSR-LRM显著优于现有基线,因为声学生物特征在这些场景中不可靠。数据和代码将公开。
推荐理由:一篇论文用推理模型做说话人识别,还建了个53万条对话的新基准,短话识别效果比现有方法强不少。
11:48
11:48官方账号arXiv cs.AI@Yunhe Li, Hao Shi, Wenhao Liu, Mengzhe Ruan, Hanxu Hou, Zhongxiang Dai, Shuang Qiu, Linqi Song
DemoPSD是一种新的策略自蒸馏框架,用于训练大语言模型推理。它通过选择性采纳教师指导,构建反向KL重心的目标分布,自动平衡教师学习与学生自身推理能力的保持。理论证明该框架能有效缓解特权信息泄露并保留探索能力。在SciKnowEval的四个科学领域上,DemoPSD的表现优于GRPO和SDPO,并在跨分布GPQA基准上展现出强泛化性。
推荐理由:这篇论文提出了DemoPSD,通过分歧调节蒸馏过程,比GRPO和SDPO在科学推理上更强,还能防止模型学到测试时无效的捷径。
11:47
11:47官方账号arXiv cs.AI@Gil Harari, Yoel Zimmermann, Ola Tangen Kulseng, Laura Zichi, Chuin Wei Tan, Marc L. Descoteaux, Boris Kozinsky
论文系统比较了Muon、SOAP和SOAP-Muon三种优化器在训练NequIP和Allegro MLIP模型时的表现。实验发现SOAP和SOAP-Muon在收敛速度和最终精度上均显著超越Adam,其中SOAP-Muon综合最优。Muon仅提供部分改进,在部分力监督场景下这些优化器优势更加明显。结果表明优化器选择是MLIP训练中一个被忽视但影响巨大的设计维度。
推荐理由:训练MLIP别再默认用Adam了,试试SOAP或SOAP-Muon,收敛更快精度更高,尤其在有部分力监督时提升明显。
11:37
11:37官方账号arXiv cs.AI@Timo Bertram, Sidhant Bhavnani, Richard Freinschlag, Erich Kobler, Andreas Mayr, Günter Klambauer
该论文提出神经符号方法G-RRM,集成SE-RRM与符号求解器(如回溯法、Glucose 4.1、CaDiCaL 3.0.0)。在9×9数独上,SE-RRM正确率91.1%,回溯法加速33.3倍,Glucose 4.1加速1.70倍(p<0.001)。CaDiCaL 3.0.0因总是遵循神经提示而非覆盖,无显著加速(中位数1.02倍,n.s.)。加速有效性取决于问题搜索空间规模及求解器能否动态覆盖分支选择。
推荐理由:这篇论文用神经网络给经典求解器指路,数独上回溯法提速33倍,但CaDiCaL不听话就没用,挺挑场景的。
11:25
11:25官方账号arXiv cs.AI@Yuquan Xue, Le Xu, Zeyi Liu, Zhenyu Wu, Zhengyi Gu, Xinyang Song, Bofang Jia, Ziwei Wang
WorldSample 提出一种物理基础的数据增强框架,通过世界模型生成高保真合成轨迹,解决真实机器人强化学习交互成本高的问题。在接触性和精密机器人操作任务中,WorldSample 将策略成功率提升 28%,训练步数减少 59%。世界模型视觉保真度提升 19.4dB PSNR 和 0.47 SSIM,验证了真实-合成循环的有效性。
推荐理由:机器人强化学习的新思路,WorldSample 用世界模型生成合成数据,成功率提28%还省了59%训练时间,值得一看。
11:21
11:21官方一手arXiv: OpenAI@Leanne P. Guy, Connor Yablonski, Aaron M. Meisner, Guillem Megias Homar, Merlin Fisher-Levine, Eman E. Ali, Tiger J. Hu, Christopher W. Stubbs
该论文为NSF-DOE Vera C. Rubin天文台开发了一个基于检索增强生成(RAG)的虚拟助手原型。系统整合了操作指南、技术笔记和科学论文等分布多平台的大量异构文档。它使用Weaviate进行嵌入存储、LangChain编排查询流程、OpenAI GPT模型作为LLM后端。通过语义搜索和对话式交互,助手将回答锚定在领域知识上,减少了幻觉,提升了准确性。
事件专题

推荐理由:这篇论文用Weaviate和LangChain搭了个RAG助手,专门帮天文台员工从文档堆里找答案,很实用,不是吹概念的那种。
11:17
11:17官方一手arXiv: Anthropic@Emerson Murphy-Hill, Jenna Butler, Alexandra Savelieva
精选
微软在2026年初向数万名工程师推广了Claude Code和GitHub Copilot CLI。研究发现首次使用主要通过社交网络扩散,留存与工程师的编码活动频率相关而非人口统计因素。采用者合并的Pull Request数量比以往约多24%,该提升在四个月的观察窗口内持续存在。这些结果基于微软内部的实际部署数据,表明命令行AI编码代理并非短期新奇效应。
推荐理由:想知道哪些工程师会长期用Claude Code和Copilot CLI吗?微软内部数万人实测告诉你:用的人都多合了24%的PR,而且全靠同事带动。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。