09:49
09:49 官方账号 arXiv cs.AI @Bohai Gu, Yueyang Yuan, Taiyi Wu, Dazhao Du, Jian Liu, Xiaoyi Pang, Jie Zhang, Xiaocheng Lu, Haobin Zhong, Xiaotong Zhao, Alan Zhao, Song Guo WorldCycle提出用可逆动作循环解决视频世界模型的误差累积问题,无需标注即可验证长时程预测。该方法构造闭合动作循环,用空间闭合奖励和时间一致性奖励优化模型,使动作成为一致的状态算子。在CycleBench基准上,WorldCycle将状态返回漂移降低44%,复合动作准确率提升近4倍。 推荐理由: 这篇论文用自验证循环替代人工标注,把世界模型的长期漂移降了44%,复合动作准确率翻近4倍,做视频生成或具身智能的可以看看。
稍后读 已读 值得跟进 有用 关注 WorldCycle
09:33
09:33 官方账号 arXiv cs.AI @Wenxiao Zhao, Dong Liu, Kaiyi Xu, Feng Liu, Zhen Zhao, Fei Ben, Shu Wang, Wenhao Li, Yingnian Wu, Fenghua Ling, Haobo Li, Lei Bai A-SR是一个自演化的智能体框架,用于从数据中发现闭式方程,将控制单元从表达式编辑转为角色条件证据视图。在LLM-SRBench的四个LSR-Synth科学领域上,A-SR将Acc@0.01从基线25.79%提升至48.30%(基于Llama3.1-8B),A-SR-LoRA将Qwen3-4B的结果从24.58%提升至38.29%。在四个真实世界科学发现任务中,A-SR在8项报告指标中的7项上取得最佳归一化均方误差。框架通过在线评估器奖励策略和状态路由过程记忆,在单次运行中无需更新参数即可自适应搜索,跨运行轨迹还可蒸馏为开源LLM的角色条件先验。 推荐理由: 符号回归老被单一大模型提示词卡住,这个A-SR让不同智能体分工盯不同失败信号,准确率从25%拉到48%,还开源蒸馏路子,值得看一眼。
稍后读 已读 值得跟进 有用 关注 A-SR
09:32
09:32 官方账号 arXiv cs.AI @Bo Wang, Yuqian Yao, Enxi Wang, Luozhijie Jin, Yang Liu, Yiran Suo, Yuxuan Cai, Enyu Zhou, Yufei Gao, Honglin Guo, Tianyu Huai, Li Ji, Zhikai Lei, Bufan Li, Lizhi Lin, Jinxiu Liu, Jie Yang, Jiazheng Zhou, Maosen Zhou, Pengfang Qian, Shichun Liu, Guanshan Liu, Hao Zheng, Yunhao Yu, Hang Yan, Jihua Kang, Xinchi Chen, Xipeng Qiu ContextWeave 是一项评估语言智能体长期记忆的新基准,基于14名参与者的多月经脱敏工作流,构建了1005个可执行任务,其中568个为核心评测任务。固定模型下,最强记忆配置将 Workspace Score 从68.08提升至78.20,Preference Score 从41.50提升至70.60。固定记忆组件时,召回记忆改善了全部5个测试基础模型的结果。分析还发现,可操作且经验丰富的记忆比紧凑摘要更能支持工作流延续,但也更容易受误导性召回影响。 推荐理由: 搞 agent 记忆的人该看看:ContextWeave 拿真实办公流做了1005个任务,能看出召回记忆到底帮不帮得上忙。
稍后读 已读 值得跟进 有用 关注 ContextWeave
09:06
09:06 官方一手 arXiv: Google DeepMind @Agnese Chiatti, Michael Cochez, Cristina Cornelio, Sebastijan Dumancic, Artur d'Avila Garcez, Luis C. Lamb, Lia Morra, Mathias Niepert, Robert Peharz, Alberto Speranzon, Maarten Stol, Annette Ten Teije, Thiviyan Thanapalasingam, Frank Van Harmelen, Emile Van Krieken, Antonio Vergari, Benjie Wang 这篇论文提出RAIL框架,从推理、保证、接口与学习四个维度指导神经符号AI系统设计。作者用RAIL分析了Google DeepMind的Alpha-*系列等神经引导搜索系统,以及工具增强的大语言模型。该框架同样适用于物理感知机器学习和因果学习等研究方向。其目标是帮助工程师在生产级AI系统设计中做出更原则性的决策。 推荐理由: 这篇论文把神经符号AI拆成RAIL四个原则,用同一套框架分析Alpha-*和工具增强LLM,搞系统设计的人可以翻翻。
稍后读 已读 值得跟进 有用 关注 RAIL
12:27
12:27 官方账号 arXiv cs.AI @Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao 论文提出 Video-DeepResearch,将多模态智能体从静态图像扩展到连续视频流,要求密集时空定位与开放网页探索结合。在 Video-DR-Bench 基准上,Video-DeepResearch-35B-A3B 平均准确率达 64.0%,超过 Claude-4.5-Sonnet(59.0%)5.0 个百分点,也优于 GPT-5(52.5%)和 Gemini 2.5 Pro(57.5%)。框架采用解耦的感知-探索流程,通过分阶段工具解锁强制跨帧视觉定位后再进行网页检索。训练结合监督微调与 GRPO,30B-A3B 变体达到 59.3%,与 Claude-4.5-Sonnet 相当。代码已开源。 推荐理由: Video-DR 让 AI 边看视频边上网核实信息,35B 参数干翻 Claude-4.5-Sonnet,还开源了,值得试试。
稍后读 已读 值得跟进 有用 关注 Video-DeepResearch
12:25
12:25 官方账号 arXiv cs.AI @Jinhe Bi, Chennan Zhou, Zengjie Jin, Aniri, Shuo Lu, Wenke Huang, Hu Cao, Xun Xiao, Zhihong Zhu, Volker Tresp, Fei Shen, Yunpu Ma, Tat-Seng Chua ReflectRL 提出从专家模型的失败轨迹中学习推理,将失败样本视为反思对象而非模仿示范。该方法基于“反思优势”假设:对难题,反思有缺陷的轨迹比从头求解更有效。ReflectRL 先利用失败轨迹生成反思推理,再通过“反思到直接策略迁移”将能力转移。在 9 个基准、4 种 LLM 骨干和 4 种在线训练方法上,ReflectRL 稳定提升推理性能且开销极小。 推荐理由: ReflectRL 把失败样本当教材,让模型先反思再直接推理。在 9 个基准上稳定提升,还挺轻量。
稍后读 已读 值得跟进 有用 关注 ReflectRL
12:19
12:19 官方账号 arXiv cs.AI @Alexander Meulemans, Maciej Wołczyk, Marissa A. Weis, Rajai Nasser, Roberta Rocca, Seijin Kobayashi, Guillaume Lajoie, Angelika Steger, Blake Richards, Marcus Hutter, James Manyika, Rif A. Saurous, João Sacramento, Blaise Agüera y Arcas arXiv 论文 2608.03958 研究基础模型智能体在社会困境中的博弈行为,发现其最优规划会稳定收敛到合作,与经典博弈论预测的相互背叛相悖。作者提出“嵌入式贝叶斯智能体”理论模型,将智能体视为宇宙的一部分,对自身决策算法保持认知不确定性。通过推断他人行为相似性,智能体将自身合作决策视为相似伙伴也会合作的证据。论文提出“嵌入式均衡”替代纳什均衡,为现代 AI 智能体的社会行为建立基础博弈论。 推荐理由: 这篇论文解释了为什么 AI 智能体比经典博弈论预测的更合作,提出了一套新理论框架,搞 AI 安全和多智能体系统的人值得看看。
稍后读 已读 值得跟进 有用 关注 博弈论
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档 (侧边栏 → AI 日报 → 顶部「往期日报」)。