7月14日
12:02
12:02官方账号arXiv cs.AI@Aastha Sharma, Guangjing Wang
VoxENES 2026是一个双语(英语和西班牙语)基准,包含53,628个音频样本,使用10种现代语音合成方法生成,在10种标准化后处理条件下评估。8个预训练检测器未经微调测试,最佳模型总体EER为28.98%,大多数接近或低于随机水平。结果凸显当前检测器依赖脆弱伪影,难以泛化到LLM驱动的TTS和语音转换。
推荐理由:新基准VoxENES 2026用5万多样本和10种现代语音合成方法,测了8个检测器,最佳EER才28.98%,说明现有检测器对LLM语音基本失效,做语音安全的朋友可以看看。
12:00
12:00官方账号arXiv cs.LG@Michael Rizvi-Martel, Satwik Bhattamishra, Guillaume Rabusseau, Michael Hahn
这篇论文聚焦Transformer的理论理解,指出已有研究大多分析其表达性,但很少涉及可学习性。受损失景观分析启发,作者初步提出了学习C-RASP构造的样本复杂度边界。该工作为理解Transformer在有限样本下的学习能力提供了理论基础。
推荐理由:这篇论文讲了Transformer的理论短板——表达性研究够了,但学不学得会还不知道。他们用C-RASP给出了样本复杂度的初步界限,对想深挖模型理论的人很有用。
11:53
11:53官方账号arXiv cs.LG@Shambhavi Balamuthu Sampath, Behzad Shomali, Nael Fasfous, Moritz Thoma, Judeson Anthony Fernando, Lukas Frickenstein, Pierpaolo Mori, Manoj Rohit Vemparala, Alexander Frickenstein, Walter Stechele
HiFi-LLP是一种基于图注意力网络的延迟预测器,引入置信度指标来判断预测可靠性。在LatBench数据集的六个设备上,HiFi-LLP的Spearman秩相关系数最高达0.996。相比先前平台特定预测器,它在10%准确率边界上提升最多9个百分点。混合NAS框架将低置信度预测路由至硬件在环测量,实现8.6倍加速同时保持竞争性的Pareto前沿。
推荐理由:想用更少的样本准确预测模型在手机上的延迟?HiFi-LLP带置信度打分,NAS提速8.6倍。
11:50
11:50官方账号arXiv cs.LG@Alper Kamil Bozkurt, Shangtong Zhang, Yuichi Motai
该论文聚焦离线到在线强化学习(O2O-RL)中有限交互预算下的策略选择问题。提出一种主动策略选择方法,通过上置信界(UCB)平衡策略评估与微调的交互分配。UCB基于局部线性性能预测,在在线评估中拟合观测数据。实验表明该方法在多个基准任务上优于现有O2O-RL基线。这是首个系统研究该问题的学术工作。
推荐理由:这篇论文解决了离线到在线RL中一个关键难题:在有限交互次数下,如何主动挑选微调策略而不是盲目均分预算。实验结果挺实在,值得做RL方向的朋友看看。
11:04
11:04官方一手arXiv: DeepSeek@Qiqi Duan, Changlun Li, Chen Wang, Fan Zhang, Mengxiang Wang, Dayi Miao, Peixian Ma, Jiangpeng Yan, Liyuan Chen, Shuoling Liu, Preslav Nakov, Yuyu Luo, Nan Tang
现有LLM交易系统评估忽视智能体经济可行性。论文提出TradeLens工具,从交易记录、运行时轨迹和部署配置重建交易轨迹,归因利润与成本。在DeepSeek-V3.2、GLM-4.7等骨干模型及多种资本规模、交易频率上测试,发现智能能否盈利取决于“智能到利润”转换效率:DeepSeek-V3.2资产选择差,GLM-4.7时机判断为负。资本规模和频率仅放大或削弱决策时机价值,并不改变根本模式。
推荐理由:想知道LLM交易模型到底能不能赚钱?这篇论文给了诊断工具TradeLens,实测DeepSeek-V3.2选股不行,GLM-4.7择时也翻车,不吹准确率而看利润转化。
11:00
11:00官方账号arXiv cs.LG@Pierre-Louis Barbarant, Florent Meyniel, Bertrand Thirion
arXiv 论文提出 SpectralOT,一种针对 fMRI 数据的功能对齐方法。它通过将皮层几何嵌入 Laplace-Beltrami 特征模态来正则化对齐过程,平衡功能特征保留与解剖结构保持。该方法在计算效率上优于传统算法,在跨被试解码任务中验证了性能提升。SpectralOT 解决了个体间脑响应变异导致的解码器泛化问题。
推荐理由:这篇论文讲了一个新的fMRI对齐方法SpectralOT,在保留解剖结构的同时提高了跨被试解码的准确性,做神经科学研究的可以看看。
10:55
10:55官方账号arXiv cs.LG@Johannes Kruse, Kasper Lindskow, Michael Riis Andersen, Ryotaro Shimizu, Julian McAuley, Pierre-Alexandre Mattei, Jes Frellsen
NAILS是一种简单可扩展的方法,通过内部标签转移将推荐系统输出与物品属性的目标分布对齐。它不需要重训练现有模型,只修改用户条件物品分布来诱导指定的边际分布。实验在多个推荐基准上显示,NAILS能持续改善属性级对齐度,且对用户参与度影响极小。该方法适用于公平性、多样性等规范性目标。
推荐理由:NAILS不用重训练就能让推荐结果更符合公平、多样性的规范,而且几乎不牺牲用户参与度,很实用。
10:02
10:02官方账号arXiv cs.AI@Parastou Fahim, Constantino Lagoa, Rômulo Meira-G'oes
现有LTL学习方案通常假设演示正确,但实际中传感器故障或数据丢失会导致轨迹不确定。本文提出用汉明距离建模不确定性,为每条观测轨迹生成多个可能估计,并通过约束确保每组至少一条与学习公式一致。问题归约为伪布尔优化,在评估中恢复的规范比现有LTL学习方法更接近真实公式。
推荐理由:这篇论文解决了现实场景中演示数据不确定的问题,用汉明距离和伪布尔优化改进LTL学习,结果更靠谱,适合做形式化验证的朋友看看。
10:01
10:01官方账号arXiv cs.AI@Filip Klubicka, Vasudevan Nedumpozhimana, Sneha Rautmare, Bora Caglayan, Mingxue Wang, John D. Kelleher
该论文系统性分析了NL2SQL翻译流水线的多个扩展组件,包括NatSQL中间表示、预处理步骤、基于合成数据的微调以及新型重排序器。基于SmBoP和RASAT两个主干架构进行消融实验与Shapley分析。结果表明简单组合所有组件并不最优,组件效果依赖于与基线系统的交互。研究为轻量化模型开发提供了指导。
推荐理由:这篇论文把NL2SQL的优化组件拆开对比,告诉你NatSQL、微调、重排序器怎么搭配才最有效,不是堆砌就行。
09:59
09:59官方账号arXiv cs.AI@Qijia Shen, Zhiqi Huang, Vamsidhar Kamanuru, Aznaur Aliev, Jay Rainton, Ahmed Awelkair, Zhichen Zeng, Jiajun Li, Shi Dong, Yueming Yuan, Boyuan Ma, Qizheng Zhang, Jiwei Fu, Yuzhen Mao, Wendong Fan, Ping Nie, Philip Torr, Bernard Ghanem, Changran Hu, Jonathan Lingjie Li, Urmish Thakker, Guohao Li
SETA是一个可扩展框架,用于生成可验证的终端环境以支持强化学习。其构建的SETA-Env数据集包含超过4500个环境,是当前最大的开源可验证终端RL数据集。使用Qwen3-8B在SETA-Env上训练,在Terminal-Bench 2.0上达到12% pass rate,为8B规模RL训练模型的最佳结果。在DeepSeek-V4-Flash上,同一终端代理基准的pass@1从40%提升至43%,pass@5从54%提升至58%。SETA-Env为终端代理研究提供了高质量的训练环境。
推荐理由:终端代理训练数据难找,SETA开源了4500+环境的RL数据集,Qwen3-8B训后Terminal-Bench拿到12%,顺带还让DeepSeek-V4涨了分,搞终端AI的别错过。
09:56
09:56官方账号arXiv cs.AI@Asher Sprigler, Yang-Yang Feng, Iftach Amir, Jonathan E. Bogard, Todd S Braver, Yi Ding, David Kinney, Yixue Zhao
论文提出一个模块化、可扩展的评估框架,旨在系统评估和增强大语言模型在心理健康领域的对齐表现。该框架集成了正念、同情、非二元推理等沉思原则,可无缝接入新模型、评估指标和基准。实验重现了现有SOTA结果,并通过灵活组合模型、指标和基准实现公平交叉评估。框架设计领域无关,可扩展至决策、道德推理与人-AI协作等场景。
推荐理由:一篇论文搞了个模块化框架,用沉思原则来评估和提升LLM在心理健康领域的对齐,还能套用到其他领域。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。