8月7日
09:25
09:25官方账号arXiv cs.AI@Modhurita Mitra, Jan-Willem Versteeg, Maarten D. Schermer, Shiva Nadi Najafabadi, Marie L. De Bruin, Lourens T. Bloem
该论文提出一个基于schema的框架,用生成式AI从非结构化文本中提取层级化、嵌套式信息,并自动与金标准做语义评估。在卫生技术评估机构NICE的文档上,该框架用Claude Opus 3成功提取了14个属性中的12个,F1分数超过90%。提取单个文档的时间比人类领域专家快约30倍。研究还验证了该框架在不同生成式AI模型间的通用性,以及在不同HTA组织和语言间的可迁移性。
推荐理由:这篇论文用Claude Opus 3从NICE文档里自动提取结构化信息,F1超90%,速度比人工快30倍,做医疗评估的朋友可以看看。
8月6日
12:23
12:23官方账号arXiv cs.AI@Boxiu Li, Zimo Wen, Yijia Fan, Junxiang Lei, Sufeng Guo, Jiaao Wu, Ruize Tang, Mukai Li, Yifei Shen, Xiaoyu Chen, Wanbo Zhang, Runjing Gu, Yifei Gao, Yuheng Wu, Xuyao Huang, Zelong Zhao, Jiachen Zhang, Shibo Hu, Hangxi Guo, Yilin Chen, Yuzhe Zhang, Fan Yang, Chuan Wen, Xian Zhang, Xuanhe Zhou, Zhijie Deng
Argus 是一个自进化的智能体运行时,由 Manager、Planner、Engineer、Reviewer 四个角色在持久项目状态上执行任务。在 SWE-Bench Pro 上达到约 78% 的通过率,高于 Direct Copilot 的 59%,但 token 消耗为后者的 1.41 倍。经过验证门控自进化后,成熟阶段的求解 token 比启动阶段少 21%,活动时间少 15%,并记录了 34 次验证器恢复和 22 次审查循环救援。在 AARRI-Bench 上取得 76.8%,数学数据合成差距为 28 分;优化后的 RWKV6 内核已合并到上游。
推荐理由:Argus 这个智能体运行时,SWE-Bench Pro 拿到 78%,比 Direct Copilot 高 19 个点,还会自我进化省 token,挺新鲜。
12:14
12:14官方账号arXiv cs.AI@Yijun Lu, Rui Ye, Jiajun Wang, Yuwen Du, Tian Jin, Songhua Liu, Siheng Chen
ABSeeker基于Qwen3.5-4B,仅用8500个示例训练,在BrowseComp上达到37.3%,在BrowseComp-ZH上达到39.1%。加入上下文管理后,成绩分别提升至55.3%和52.9%,超过同规模4B智能体,并赶上约30B参数的更大模型。其核心是ABC框架,通过答案回溯恢复线索,再将搜索每一步与线索比对,生成细粒度步骤级奖励。
推荐理由:它用答案倒推给搜索智能体每一步打分,4B模型在BrowseComp上拼到55.3%,能对标30B模型,值得看方法。
11:44
11:44官方账号arXiv cs.LG@Dibyajyoti Chakraborty, Romit Maulik
本研究提出一种基于潜视频流匹配的统一大气数据同化方法。该方法使用ERA5再分析数据(69个变量、8天窗口)训练先验模型。通过后验采样,可同化NOAA综合探空仪档案和地面站数据等真实观测。由于先验生成连续轨迹,能自然实现滤波、平滑等任务,并支持从稀疏观测直接生成集合预报。
推荐理由:这篇论文用流匹配生成模型做大气数据同化,拿ERA5先验加NOAA观测,不用传统递推迭代,能直接做滤波平滑和集合预报,还挺巧妙的。
11:23
11:23官方账号arXiv cs.LG@Arunava Majumder, Marius Krumm, Hendrik Poulsen Nautrup, Hans J. Briegel
该论文证明在固定浅层深度下,共享经典随机性足以让通道量子生成模型严格超越对应的浅层幺正Born模型。具体做法是用单一经典采样随机比特控制空间分离的局域泡利操作,生成经典输出分布中的长程关联。对于一维最近邻架构,纯幺正模型复现这类分布最坏需要深度Ω(N)。作者进一步用基于测量量子计算(MBQC)实现了所需共享经典随机性,数值实验支持理论结果。
推荐理由:这篇arXiv论文给出了浅层量子生成模型的一个严格分离证明:加一点经典随机性就能生成纯幺正模型复制不了的分布,还给了MBQC实现方案。
11:22
11:16
11:16官方账号arXiv cs.LG@Zheyuan Zhang, Manqing Mao, Hong Wang, Zhuoer Wang, Samson Koelle, Jie Yuan, Yanjun Lin, James Feng, Nikki Lijing Kuang, Yanfang Ye, Wei Niu
RAIL是一种训练时框架,通过在线上下文bandit建模干预选择,学习如何为策略生成rollout。它利用影子到实时程序收集干预轨迹,训练恢复控制器,使控制器随策略演化持续学习。在多个设置下,RAIL在有限rollout预算下持续提升性能。结果表明恢复感知干预能生成更有信息量且更少冗余的rollout,增强后训练的学习信号。
推荐理由:这篇论文提出RAIL,把干预选择当成在线学习问题,让模型在有限预算下学到更有效的rollout,适合做RL后训练的人看。
10:46
10:46官方一手arXiv: DeepSeek@Réemi Andrieu, Damien Sileo
精选
研究构造了前提相同但框架或域条件不同的配对模态问题,自动推理验证了相反标签。在平衡核心测试中,直接提示下五款近期模型中有四款表现低于条件基线。启用推理模式后,DeepSeek V4 Flash在相同提示下从4.4%升至88.1%。结果表明模型遵循规定语义的能力高度依赖推理模式和模型身份。
推荐理由:这篇论文测了语言模型会不会按给定的模态逻辑规则推理,DeepSeek V4 Flash开推理模式后从4.4%直接飙到88.1%,反差很大,可以看看。
10:26
10:26官方账号arXiv cs.LG@Zidu Yin, Yuankai Qi, Dong Gong, Ehsan Abbasnejad, Kun Yue, Javen Qinfeng Shi
该论文提出名为 IGNP 的链接预测框架,将节点对间关系建模为影响传播。方法扩展 SIR 流行病模型,通过子图结构捕捉大规模节点影响。IGNP 利用虚拟边压缩子图,显著降低全局图结构的计算开销。在公开真实数据集上,IGNP 大幅优于现有强基线。
推荐理由:这篇论文把传染病传播模型用到链接预测上,搞了个IGNP框架,在真实数据集上比现有方法强不少。
10:11
10:11官方账号arXiv cs.LG@Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkinos, Mike Lewis
该论文通过合成和真实数据上的受控实验,揭示了多模态预训练中语言、视觉理解与视觉生成之间的非对称知识流。研究发现数据复杂度决定模态协同,共享注意力与归一化能促进协同,而早期联合训练优于晚期对齐。实验还发现“视觉懒惰”现象,即延迟融合会导致模型依赖语言先验。作者提出的高效配方仅用5%计算预算即可达到强生成性能,并训练了13.5B MoE模型在2T tokens上验证结论。
推荐理由:这篇论文把多模态预训练的内部机制拆开了,告诉你模态之间怎么互相影响、什么时候协同、什么时候拖后腿,还有省算力的训练配方,值得看看。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。