8月6日
09:59
09:59官方账号arXiv cs.AI@Xiaoyan Gu, Yifang Wang, Wenqing Zheng, Haozhong Liu, Yixia Zheng, Peiyi Jiang, Wenjie Ning, Wei Zhang, Wei Chen
论文提出双向人机增强框架BiHAA,并在ArtAnno系统中实现。系统基于多智能体架构,包含主动式智能体支持模块和交互驱动进化模块。研究团队与20名艺术品标注人员开展形成性研究,并通过用户研究和两个案例评估效果。结果显示该方法减少了标注者信息检索和核验成本,同时提升了标注效率。
推荐理由:做艺术标注的可以看:ArtAnno用LLM智能体挖隐含语义,还把标注经验回传给AI,双向增强。
09:49
09:49官方账号arXiv cs.AI@Bohai Gu, Yueyang Yuan, Taiyi Wu, Dazhao Du, Jian Liu, Xiaoyi Pang, Jie Zhang, Xiaocheng Lu, Haobin Zhong, Xiaotong Zhao, Alan Zhao, Song Guo
WorldCycle提出用可逆动作循环解决视频世界模型的误差累积问题,无需标注即可验证长时程预测。该方法构造闭合动作循环,用空间闭合奖励和时间一致性奖励优化模型,使动作成为一致的状态算子。在CycleBench基准上,WorldCycle将状态返回漂移降低44%,复合动作准确率提升近4倍。
推荐理由:这篇论文用自验证循环替代人工标注,把世界模型的长期漂移降了44%,复合动作准确率翻近4倍,做视频生成或具身智能的可以看看。
09:48
09:48官方账号arXiv cs.AI@David Carral, Calixte Gruson, Quentin Manière
论文针对Horn-ALCHI本体上的原子查询,研究能否重写进ISO标准GQL。作者提出DL自动机形式化描述这类查询在事实集合上的运行过程。他们找出一类状态分层、避免特定循环依赖的DL自动机,可转换为UC2RPQ。UC2RPQ是GQL的核心片段,因此该条件覆盖了一批此前无法重写的Horn-ALCHI OMQ。
推荐理由:想知道哪些Horn-ALCHI本体查询能改写成GQL?这篇给出DL自动机判据,一批以前没法重写的查询现在有解了。
09:37
09:37官方账号arXiv cs.AI@Leah Davis, Dominic Martin, AJung Moon
本综述扫描了4,259篇文献,最终纳入58项AI审计研究。通过反思性主题分析,发现现有审计很少针对系统集成特有风险。研究将系统集成审计分为组件间、系统-环境、多系统三类。这些审计评估兼容性、完整性和监督等集成特质。综述建议AI社区将系统集成作为审计核心策略。
推荐理由:想了解AI审计盲区?这篇综述翻了4259篇文献,发现只有58篇关注系统集成,现有审计忽略了组件交互风险,值得看看。
09:33
09:33官方账号arXiv cs.AI@Jacob Arndt, Debvrat Varshney, Philipe Dias, Nivedita Nukavarapu
该论文提出一个用于卫星图像篡改检测与定位的原型基准数据集,包含60张图像,其中30张经复制粘贴拼接或扩散模型修复等方式篡改,另30张为真实图像。每张图像都配有像素级真值掩码和采集元数据,支持定位性能评估。数据集已发布在HuggingFace平台,可免费下载。
推荐理由:遥感领域缺精细的篡改定位数据集,这个原型集合了拼接和扩散修复两类篡改,还带掩码和元数据,做取证研究可以直接拿来测。
09:32
09:32官方账号arXiv cs.AI@Bo Wang, Yuqian Yao, Enxi Wang, Luozhijie Jin, Yang Liu, Yiran Suo, Yuxuan Cai, Enyu Zhou, Yufei Gao, Honglin Guo, Tianyu Huai, Li Ji, Zhikai Lei, Bufan Li, Lizhi Lin, Jinxiu Liu, Jie Yang, Jiazheng Zhou, Maosen Zhou, Pengfang Qian, Shichun Liu, Guanshan Liu, Hao Zheng, Yunhao Yu, Hang Yan, Jihua Kang, Xinchi Chen, Xipeng Qiu
ContextWeave 是一项评估语言智能体长期记忆的新基准,基于14名参与者的多月经脱敏工作流,构建了1005个可执行任务,其中568个为核心评测任务。固定模型下,最强记忆配置将 Workspace Score 从68.08提升至78.20,Preference Score 从41.50提升至70.60。固定记忆组件时,召回记忆改善了全部5个测试基础模型的结果。分析还发现,可操作且经验丰富的记忆比紧凑摘要更能支持工作流延续,但也更容易受误导性召回影响。
推荐理由:搞 agent 记忆的人该看看:ContextWeave 拿真实办公流做了1005个任务,能看出召回记忆到底帮不帮得上忙。
09:28
09:28官方账号arXiv cs.LG@Xuanyu Lei, Yiqi Zhu, Chenliang Li, Kaiming Liu, Peng Li, Ming Yan, Jieping Ye, Ya-Qin Zhang, Yang Liu
State2State是一种从环境交互中派生训练目标的方法,无需外部指定的任务或人工监督。它通过规则匹配状态来验证智能体是否到达目标状态,从而提供可扩展且可验证的训练信号。在ALFWorld和ScienceWorld基准上,State2State作为独立训练阶段在多数设置下提升了智能体性能。用作下游强化学习的初始化时,它进一步提高了最终性能和采样效率,并展现出跨环境泛化的潜力。
推荐理由:这篇论文提出了一种不用人工任务标注的训练方法,让LLM智能体自己从环境里找目标学,在ALFWorld和ScienceWorld上有效,还能给后续强化学习打底子。
09:26
09:26官方账号arXiv cs.LG@Zonghuan Xu, Krishna Harish
该论文通过过参数化线性回归模型分析渐进适应的训练时间分配。当任务数N增大且每任务训练时间为s_N时,若Ns_N趋近τ,学习进度收敛为连续曲线。进度在小τ时按Θ(τ)增长,大τ时按Θ(1/τ)下降,因此最优每任务训练时间缩放为s_N^*=Θ(1/N)。实验在逐渐旋转的MNIST和Yearbook时间偏移上验证了该结论。
推荐理由:这篇论文发现:渐进适应时任务分得越细,每个任务训练时间反而要按1/N缩放。用MNIST和Yearbook验证了,做持续学习的朋友可以看看。
09:23
09:23官方账号arXiv cs.LG@Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu
TD-V2A是一种基于扩散模型的视频到音频生成方法,利用时间差异作为区分视频与图像的关键表示。研究对比了帧级和特征级的时间差异,发现特征级更有效。该方法引入分层持续学习策略和退火时间差异引导,在基准数据集上取得优于对比音视频预训练的效果。
推荐理由:这篇论文提出用时间差异做视频生成音频,不用额外网络,效果还超过了对比预训练方法,值得做V2A的人看看。
09:06
09:06官方一手arXiv: Google DeepMind@Agnese Chiatti, Michael Cochez, Cristina Cornelio, Sebastijan Dumancic, Artur d'Avila Garcez, Luis C. Lamb, Lia Morra, Mathias Niepert, Robert Peharz, Alberto Speranzon, Maarten Stol, Annette Ten Teije, Thiviyan Thanapalasingam, Frank Van Harmelen, Emile Van Krieken, Antonio Vergari, Benjie Wang
这篇论文提出RAIL框架,从推理、保证、接口与学习四个维度指导神经符号AI系统设计。作者用RAIL分析了Google DeepMind的Alpha-*系列等神经引导搜索系统,以及工具增强的大语言模型。该框架同样适用于物理感知机器学习和因果学习等研究方向。其目标是帮助工程师在生产级AI系统设计中做出更原则性的决策。
推荐理由:这篇论文把神经符号AI拆成RAIL四个原则,用同一套框架分析Alpha-*和工具增强LLM,搞系统设计的人可以翻翻。
8月5日
12:31
12:31官方账号arXiv cs.AI@Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun Xu
TurnSight 是一个面向工具集成推理(TIR)的回合级事后自蒸馏框架。TurnSight 不从轨迹级或令牌级反馈学习,而是基于执行条件的事后状态生成监督信号。TurnSight 构造多个不同前瞻视野的事后视图,并通过跨视野方向一致性筛选可靠信号。论文在三个基准上验证了效果,代码已开源在 GitHub。
推荐理由:TurnSight 把工具推理的强化学习拆到回合级,用事后视角筛信号,三个基准上都有效,代码开源了。
12:27
12:27官方账号arXiv cs.AI@Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao
论文提出 Video-DeepResearch,将多模态智能体从静态图像扩展到连续视频流,要求密集时空定位与开放网页探索结合。在 Video-DR-Bench 基准上,Video-DeepResearch-35B-A3B 平均准确率达 64.0%,超过 Claude-4.5-Sonnet(59.0%)5.0 个百分点,也优于 GPT-5(52.5%)和 Gemini 2.5 Pro(57.5%)。框架采用解耦的感知-探索流程,通过分阶段工具解锁强制跨帧视觉定位后再进行网页检索。训练结合监督微调与 GRPO,30B-A3B 变体达到 59.3%,与 Claude-4.5-Sonnet 相当。代码已开源。
推荐理由:Video-DR 让 AI 边看视频边上网核实信息,35B 参数干翻 Claude-4.5-Sonnet,还开源了,值得试试。
12:25
12:25官方账号arXiv cs.AI@Jinhe Bi, Chennan Zhou, Zengjie Jin, Aniri, Shuo Lu, Wenke Huang, Hu Cao, Xun Xiao, Zhihong Zhu, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng Chua
ReflectRL 提出从专家模型的失败轨迹中学习推理,将失败样本视为反思对象而非模仿示范。该方法基于“反思优势”假设:对难题,反思有缺陷的轨迹比从头求解更有效。ReflectRL 先利用失败轨迹生成反思推理,再通过“反思到直接策略迁移”将能力转移。在 9 个基准、4 种 LLM 骨干和 4 种在线训练方法上,ReflectRL 稳定提升推理性能且开销极小。
推荐理由:ReflectRL 把失败样本当教材,让模型先反思再直接推理。在 9 个基准上稳定提升,还挺轻量。
12:19
12:19官方账号arXiv cs.AI@Alexander Meulemans, Maciej Wołczyk, Marissa A. Weis, Rajai Nasser, Roberta Rocca, Seijin Kobayashi, Guillaume Lajoie, Angelika Steger, Blake Richards, Marcus Hutter, James Manyika, Rif A. Saurous, João Sacramento, Blaise Agüera y Arcas
arXiv 论文 2608.03958 研究基础模型智能体在社会困境中的博弈行为,发现其最优规划会稳定收敛到合作,与经典博弈论预测的相互背叛相悖。作者提出“嵌入式贝叶斯智能体”理论模型,将智能体视为宇宙的一部分,对自身决策算法保持认知不确定性。通过推断他人行为相似性,智能体将自身合作决策视为相似伙伴也会合作的证据。论文提出“嵌入式均衡”替代纳什均衡,为现代 AI 智能体的社会行为建立基础博弈论。
推荐理由:这篇论文解释了为什么 AI 智能体比经典博弈论预测的更合作,提出了一套新理论框架,搞 AI 安全和多智能体系统的人值得看看。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。