6月23日
10:38
10:38官方账号arXiv cs.LG@Pengfei Li, Mohammad Khalil
Fed-CausalDiff是一种联邦因果扩散框架,专门用于“do-simulation”和政策评估。它将潜在状态演化分解为全局因果评分函数和局部混淆评分函数,实现解耦同步(DSS),客户端只聚合共享因果机制而保留本地特定混淆。在四个数据集上的实验显示,Fed-CausalDiff在ATE和政策价值估计精度上优于传统方法,并在通信成本与推理保真度之间取得更好平衡。
推荐理由:这篇论文提出Fed-CausalDiff,让联邦学习不仅能拟合历史数据,还能做因果干预模拟。它在四个数据集上比常规方法更准,而且通信开销可控,适合分布式医疗或金融场景。
10:35
10:35官方账号arXiv cs.LG@Talia Sternberg, Gallil Maimon, Yossi Adi
该论文分析了来自不同模型族和规模的交错语音文本语言模型,发现它们会在中间层隐式转录语音对应的文本词,其中77%的数据中该文本词出现在Top候选词中。随后模型在文本空间预测下一个词,再转回语音域。研究还表明,交错训练数据和文本LM初始化是诱发该行为的关键,且该行为与口语知识能力相关。
推荐理由:这篇论文让你搞懂语音语言模型内部是怎么偷偷把语音转成文本再推理的,分析得很透彻,适合想深入理解多模态模型原理的人。
10:32
10:32官方账号arXiv cs.LG@Mathieu Delcluze, Léa Briand, Benjamin Chapus, Deniz Mekik, Guillaume Salha-Galvan
Deezer在2025年部署了基于大型语言模型(LLM)的自动播放列表标注系统。该系统为Daily Mix功能生成自然语言描述,覆盖数百万用户。部署后用户参与度显著提升,表明语义描述如何影响用户对个性化推荐的感知。论文发表于arXiv,编号2606.22460v1。
推荐理由:Deezer用LLM给每日推荐写标题,百万用户真用上了,参与度还涨了——不是PPT,是上线产品。
6月19日
11:46
11:46官方账号arXiv cs.LG@Georgy Noarov, Aaron Roth
这篇论文提出了一种确定性多校准算法,达到最小最大最优的样本复杂度率 O~(ε⁻³),解决了此前只有随机算法能达到该复杂度而确定性算法样本复杂度更差的开放问题。算法进一步推广到结果不可区分性(OI)和全预测器,给出了针对有限或有限覆盖测试集合的最优确定性预测器。这解决了CLNR26和OKK25等先前工作中明确提出的开放问题。
推荐理由:这篇论文解决了机器学习里一个悬而未决的问题:确定性多校准算法终于能像随机算法一样高效了。如果你关心公平性、可信预测的样本效率,可以看看他们怎么做到的。
11:41
11:41官方账号arXiv cs.AI@Joshua Engels, Callum McDougall, Bilal Chughtai, Janos Kramar, Senthoran Rajamanoharan, Cindy Wu, Arthur Conmy, Asic Q Chen, Jean Tarbouriech, Min Ma, Brendan O'Donoghue, João Gabriel Lopes de Oliveira, Rohin Shah, Neel Nanda
71°
论文分析 DiffusionGemma 的推理透明度,将其分解为变量透明度和算法透明度。初始发现 DiffusionGemma 的不透明串行深度是自回归 Gemma 4 的 28.6 倍。但通过可解释的 token 瓶颈映射信息流,可将不透明串行深度降至仅 Gemma 4 的 1.1 倍。算法透明度方面,扩散模型因每步所有 token 可变化而更复杂,研究识别了非时间顺序推理、token 与序列涂抹、中间上下文推理等新现象。可监控性测试表明 DiffusionGemma 与 Gemma 4 水平相当。
事件专题

推荐理由:Google 团队这篇论文解释 DiffusionGemma 的推理黑箱有多大,发现能用 token 瓶颈把深度压到几乎和 Gemma 4 一样,还发现了扩散模型特有的奇怪推理方式。
11:38
11:38官方账号arXiv cs.AI@Md Nayem Uddin, Amir Saeidi, Eduardo Blanco, Chitta Baral
LedgerAgent是一种推理时方法,维护工具调用智能体的观察任务状态在独立账本中,并渲染到提示中。该方法在执行环境变更工具调用前检查状态依赖策略约束,阻止违反。在四个客户服务领域和开源/闭源混合模型面板上,相比标准提示工具调用方法,平均pass^k提升。更严格的多试一致性指标下增益最大。
推荐理由:这篇论文提出了LedgerAgent,用独立账本管理状态,防止智能体用过时信息或违反政策,在多个客服场景和模型上明显提升工具调用的准确率。
11:37
11:37官方账号arXiv cs.AI@Saimun Habib, Vaishak Belle, Fengxiang He
DeepSWIP为DeepProbLog引入单世界反事实语义,通过神经具体化将固定上下文神经谓词转为ProbLog选择,并应用单世界干预程序(SWIP)计算反事实。实验在MPI3D数据集上对比DeepTwin构造,针对12,000个查询实现2.14倍推理加速。SUMO HOV实验表明神经校准退化会偏误插件估计,而AIPW估计器可消除大部分一阶偏差。代码已开源。
推荐理由:想给概率逻辑程序加上精准的反事实推理?DeepSWIP用商WMC方法避免了DeepTwin的内生重复,实测快两倍多,做因果推断的朋友可以看看。
11:32
11:31
11:31官方账号arXiv cs.AI@Alaia Solko-Breslin, Pramod Kaushik Mudrakarta, Mihai Christodorescu, Somesh Jha, Krishnamurthy Dj Dvijotham
论文提出基于分布鲁棒优化(DRO)的框架,用于AI Agent在不确定性下的策略违反概率验证。该方法支持包含概率谓词或状态转换的Datalog策略,无需假设谓词间独立性。在终端和工具调用Agent标准基准上,计算出的概率上界比先前方法更紧,同时保证了安全与效用的权衡。实验表明,该方法在多个测试集上提升了安全策略的合规性。
推荐理由:这篇论文给AI Agent加了一道安全锁:用分布鲁棒优化算清楚策略违规的概率上限,比旧方法更准、更高效。
11:04
11:04官方账号arXiv cs.LG@Haw-Shiuan Chang, Jeffrey Gomez, Mehul Patwari, Aryan Sajith, Hamed Zamani
这篇论文提出利用用户与LLM交互时的鼠标轨迹和眼动数据作为隐式反馈来替代昂贵的显式偏好标注。他们构建了IFLLM数据集,包含59名用户的1336个多轮问答,并记录了鼠标和眼动数据。基于这些隐式反馈训练的奖励模型将文本奖励模型的准确率从55%提升到64%。对8个LLM应用DPO后,响应质量相对提升近3倍,证明了隐式反馈在真实场景中的价值。数据集和代码已开源。
推荐理由:别光看用户点了什么赞,鼠标和眼睛动的方向才是真心话。这篇论文用59人的眼动和鼠标轨迹数据训练奖励模型,准确率从55%飙到64,还开源了数据集。
11:03
11:03官方账号arXiv cs.LG@Yusuf Salcan, Simon Ging, Robin Schirrmeister, Philipp Arnold, Elmar Kotter, Behzad Bozorgtabar, Thomas Brox
论文提出RefRad2D数据集,包含120万CT和MR图像-文本对,覆盖德语和英语。该数据集通过LLM标注和自动分割生成任务特定的VQA和空间定位子集。基于此训练的RadGrounder模型同时支持报告生成、视觉问答和边界框检测/分割。在Slake和VQA-RAD外部基准上,RadGrounder取得与专用医学VLM竞争的结果。加入临床数据训练可提升开放VQA表现,且增加空间定位监督不降低语言质量。
推荐理由:这篇论文开源了120万对的放射学双语数据集RefRad2D,训练出的RadGrounder能同时做报告生成、VQA和空间定位,空间定位还不影响语言质量,搞医疗AI的值得看看。
11:02
11:02官方账号arXiv cs.LG@Mingyu Yang, Keye Zheng, Congchao Cheng, Yujie Liu, Xingkang Lu, Fan Jiang, Yefei Zheng
现有批量式轨迹蒸馏中,同一记忆操作在不同批次间可能收到矛盾反馈,缺乏跨批次操作级证据累积机制。MAA通过构造差分信号使证据跨批次可比,利用指数移动平均累积每操作符号证据,并通过语义身份合并保证跨批次可追溯。在4个基准和4个目标模型的16个设置中,MAA取得14个最佳结果,一致优于现有批量级蒸馏基线。优化阶段token消耗减少约75%。
推荐理由:这篇论文提出MAA,能让智能体自我进化时跨批次累积有效操作,减少75%的token消耗,在多个基准上超过现有方法。
11:01
11:01官方账号arXiv cs.LG@Inesh Chakrabarti, David Limpus, Aditi Ghai Rana, Bowen Bao, Spandan Tiwari, Thiago Crepaldi, Ashish Sirasao
论文提出UltraQuant,一种针对智能体工作负载的4位KV缓存压缩方法,基于TurboQuant旋转和码书量化。在长上下文多轮任务中,UltraQuant在缓存压力大的后期轮次将P50首令牌延迟降低3.47倍,全轮次平均降低2.3倍。相比FP8 KV缓存基线,输出吞吐量提升1.63倍。设计包括非对称K/V处理、Walsh-Hadamard旋转及AMD GPU专用优化。
推荐理由:长上下文智能体推理慢?UltraQuant把4位KV缓存做到实用,延迟降3倍多,吞吐涨1.6倍,值得看看。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。