7月23日
11:22
11:22官方账号arXiv cs.AI@Mahdi Heidari, Mohammad Mahdi Rahimi, Jaekyun Moon
ELSAA提出一种结合稀疏和低秩分支的注意力近似方法,避免显式计算完整的N×N注意力矩阵。稀疏分支捕捉高相似度交互,低秩分支压缩全局信息,并通过分母感知融合项平衡两者。该方法旨在支持更长上下文训练,同时保留token级交互和上下文混合能力。在多个长序列基准上验证了其效率与效果。
推荐理由:这篇论文把稀疏和低秩两种思路拧在一起,解决Transformer的长序列瓶颈。不用算完整的注意力矩阵,就能同时抓住局部和全局信息。
10:00
10:00官方一手arXiv: DeepSeek@Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu, Jian Meng, Zhengxuan Lu, Yiting Wang, Yucheng Xie, Tao Guo, Tianxiang Fang, Jing Li, Sihang Chen, Shihao Hong, Chang Liu, Weihua Dai, Zirong Zeng, Ziwei Zhu, Zhuohan Wang, Zhengjun Yue, Igor Vasilyev, Min Liu, Weijian Sun, Xin Chen, Yingmeng Gao, Jinhua Zhou, Taolue Chen, Chenwei Wu, Dong Zhang, Wenlong Jin, Jinmin Xiang, Barkova Maria, Ushakov Anton, Xianfei Jin, Tian Ding, Zhihang Lin, Qian Chen, Linxin Yang, Mingzhe Yang, Bingwei Zhang, Hongzhang Yang, Fangxue Zhang, Shijun Qin, Jie Yu, Cuihua Hu, Tolstykh Vasiliy, Nosov Ivan, Abdullin Amir, Zhichen Zhou, Xin Zhang, Zhixiong Ning, Xutong Zhao, Junjie Huang, Jiajun Liu, Weiyan Kong, Zheng Zhang, Wenhan Luo, Lin Hu, Yangbo Guo, Li Zeng, Shihao Zeng, Baotian Hu, Min Zhang, Haizhou Li, Zhiquan Luo
精选
该论文针对万亿参数MoE模型DeepSeek-V4在Ascend NPU SuperPOD上的全参数后训练,提出分层优化框架,实现34.22%的模型算力利用率(MFU),较开源基线提升2.93倍。基于优化基础设施,论文构建了面向运筹学(OR)任务的连续预训练(CPT)和微调(SFT)工作流。SFT数据集包含10K高质量样本,涵盖4个任务类别和3种问题表示。专用模型DeepSeek-V4-Flash-OR在零样本Pass@1上达到71.81%,比GPT-5.4-Mini高3.98个百分点,比基础DeepSeek-V4-Flash高11.27个百分点。
推荐理由:这篇论文展示了如何在华为Ascend芯片上高效后训练万亿参数模型,并且通过运筹学专用微调,在特定任务上超越了GPT-5.4-Mini。
7月22日
12:59
12:59官方账号arXiv cs.AI@Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch, Srinath Sridhar, Matheus Gadelha
论文提出Appearance Pointers,一种紧凑的额外token,用于指导扩散变换器(DiT)在指定空间区域获取正确的纹理、对象身份等外观信息。该方法通过区域对应网络生成token,并用空间聚合机制优化,无需重新训练基础DiT模型即可处理多个区域描述。在多个基准测试上,单模型性能达到或超越针对特定模态的现有方法,实现了首个模态无关的局部多模态控制接口。
推荐理由:这篇论文搞了个Appearance Pointers,能让DiT模型精确指定图片不同区域该长什么样,不用重训模型,效果还比那些专门的方法好。
12:57
12:57官方账号arXiv cs.AI@Qijia He, Jiayi Cheng, Chenqian Le, Rui Wang, Xunmei Liu, Yixian Chen, Jie Mei, Zhihao Wang, Xupeng Chen, Yuhuan Chen, Tao Wang
该论文提出CodeRescue框架,用于编程智能体失败后的恢复路由决策。通过监督路由器从执行轨迹中学习,选择廉价恢复或升级到更强模型。添加Conformal Risk Control(CRC)层,无需重新训练即可适应不同预算,提供边际期望成本控制。在五个编程基准的失败案例上,校准前沿优于固定动作、仅提示路由器和二元级联基线。在GPT-5.4-nano/GPT-5.4设置下,一个CRC校准前沿点比始终升级的解决率更高,且平均恢复成本仅为其35%。
推荐理由:编程智能体失败后,是再用便宜模型试试还是直接上贵的?这篇论文搞了个路由器和校准方法,在GPT-5.4-nano上省了65%的钱还保证解决率不降。
12:56
12:56官方账号arXiv cs.AI@Grace Hui Yang, Pranav N. Venkit, Hooman Sedghamiz, Enrico Santus, Victor Dibia, Ioana Baldini
本教程汇总了基于大语言模型(LLM)的智能体系统在软件工程、科学发现和金融等领域的生产级部署经验。内容涵盖推理与规划、多智能体协调和评估等研究进展,以及来自实际部署的挑战。通过制药发现和金融系统的应用案例,分析了成功设计模式和失败缓解策略,包括验证管线、回退机制和人在环路监督。
推荐理由:这篇论文从实际部署出发,总结了LLM智能体在软件、金融等领域的成功模式和失败应对,比只看benchmark的研究更有实战价值。
12:50
12:50官方账号arXiv cs.AI@Jason Stanley, Zhirui Dai, Qihao Qian, Tzu-Chin Ho, Tianxing Fan, Siddharth Saha, Christopher Barngrover, Ki Myung Brian Lee, Nikolay Atanasov
本文提出OREN(Octree Residual Network)与Bubble*规划器,协同实现无人机实时有符号距离函数(SDF)建图和运动规划。OREN结合显式八叉树与隐式神经残差,在线重建SDF,精度比基线高22%。Bubble*利用距离信息生成最大无碰撞球体,在杂乱环境中规划约90米轨迹仅需1-3秒,而基线需10秒。系统在四旋翼无人机上实时运行。
推荐理由:这篇论文把建图和规划合着做,用OREN神经网络重建距离场,Bubble*算法找安全球路径。无人机飞90米只要1到3秒,比别的快10倍。
12:23
12:23官方账号arXiv cs.LG@Davide Murari, Marta Ghirardelli, Ben Adcock, Elena Celledoni, Brynjulf Owren, Carola-Bibiane Schönlieb
论文提出一种在Hadamard流形上构造1-Lipschitz神经网络的方法,使用Busemann函数作为核心构建块,设计出梯度下降类型的1-Lipschitz层。在庞加莱圆盘上进行鲁棒分类实验,面对超几何扰动时分类器保持稳定。在对称正定(SPD)矩阵流形上训练无扩张去噪器,用于掩码Wishart协方差重建问题,结果优于静态、仅数据和对数欧几里得去噪基线。实验还验证了该去噪器的收敛性质。
推荐理由:这篇论文给出了一种在非欧空间(如双曲流形、SPD流形)上构建Lipschitz可控神经网络的具体方法,想处理流形数据或者关心模型鲁棒性的朋友可以看看。
12:22
12:22官方账号arXiv cs.LG@Ioannis Papageorgiou, Srinivas Nomula, Ayalvadi Ganesh, Sidharth Jaggi, Parimal Parag
该论文研究了如何组合O(log K)个简单二元分类器(超平面)来构建K类分类器。在K个类中心为独立高斯点、观测受高斯噪声污染的设定下,推导了不同解码和维度区间的显式性能界限。大量仿真实验验证了理论结果的有效性。
推荐理由:这篇论文告诉你用少数几个二分类器拼多分类器到底能做到多好,有理论保证,做分布式分类的值得看看。
12:07
12:06
12:06官方账号arXiv cs.LG@Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi
标准RLVR在模型无法生成任何正确答案时会得到零学习信号,导致困难问题无法收敛。Off-Context GRPO通过在训练中引入解法前缀作为特权引导,使模型获得非零奖励。该方法通过重要性校正目标避免引导与原始目标的偏差,在标准数学推理基准上比vanilla GRPO平均绝对提升3.9%(相对提升13.8%),且额外成本可忽略。
推荐理由:模型一遇到难题就原地踏步?这篇论文给出了一个简单又有效的解法:给模型一点'提示',效果直接涨3.9%,成本几乎为零。
12:05
12:05官方账号arXiv cs.LG@Lance Kennedy, Hossein Amiri, Yueyang Liu, Riyang Bao, Hanqi Chen, Mohammad Hashemi, Ruochen Kong, Xiaotong Liu, Joon-Seok Kim, Shengpu Tang, Liang Zhao, Andreas Züfle
该论文引入了16个大规模模拟数据集,每个数据集包含数千个智能体的轨迹及带注释的驻留点,并涵盖不同的轨迹噪声水平。作者评估了9种驻留点检测算法,包括现有最优方法和新提出的方法。结果显示,现有算法在真实噪声条件下表现较差,而提出的无监督方法有显著改进,监督方法则大幅超越现有基线。该论文指出,这些数据集和方法仅作为未来研究的起点。
推荐理由:这篇论文提供了16个带噪声的轨迹数据集和9种驻留点检测算法评估,发现现有方法在真实噪声下效果差,而他们的新方法提升明显,对做轨迹分析的人很有参考价值。
11:40
11:40官方账号arXiv cs.LG@Alessandro Scalese, Santhanakrishnan Narayanan, Constantinos Antoniou
论文提出GUIDED初始化层,将交通需求作为虚拟链路的标量属性,实现网络无关输入。在多个城市拓扑上测试,HetGAT+GUIDED在单网络任务上保持先进精度。该方法对分布外需求模式鲁棒,数据稀缺时性能优势明显。训练时间每epoch减少约50%。该方法可推广到物流、多模态网络等OD空间问题。
推荐理由:这篇论文提出了GUIDED层,让GNN模型能跨城市迁移做交通分配,训练还快了一半,不是画饼。
11:35
11:35官方账号arXiv cs.LG@Joscha Cüppers, Jilles Vreeken
本文提出MASHT方法,将MultiRocket和Hydra随机卷积特征与预训练表格基础模型结合,完全跳过任务特定训练。在单变量时间序列分类上,MASHT的平均排名低于HIVE-COTE 2.0。在多变量数据集上,MASHT与最强基准方法竞争激烈。实验表明该方法无需训练即可匹配领先结果。
推荐理由:想不训练模型就做时间序列分类?试试MASHT,把MultiRocket特征丢给表格基础模型,单变量任务已经干掉HIVE-COTE 2.0了。
11:27
11:27官方一手arXiv: DeepSeek@Tianyue Jiang, Yanlin Wang, Xin He, Daya Guo, Jiachi Chen, Ming Wen, Ensheng Shi, Xilin Liu, Yuchi Ma, Guanbin Li
PhoenixRepair是一个多智能体框架,通过多位置采样和迭代反思扩大修复策略搜索空间。在SWE-bench-Verified上,相比SWE-agent在DeepSeek-V3.1下实现7.8%的相对提升。在MiniMax-M2.5下达到76.0% Pass@1的最高解决率。该框架的故障定位准确率也优于现有方法。
推荐理由:新论文的PhoenixRepair能更系统地探索代码修复位置,在SWE-bench上比SWE-agent提升了7.8%,做软件工程的值得一看。
11:24
11:24官方一手arXiv: DeepSeek@Yin Wu, Yixuan Liu, Yi Li, Chenyang Peng, Hao Wu, Ming Fan, Ting Liu, Haijun Wang
论文系统化分析了ERC-20代币合约中隐蔽陷阱的分类,提出基于代币功能生命周期的分类法。TrapHunter框架结合抽象行为树(ABT)与增强路径图(APG)统一语义表示,利用LLM推理行为意图偏差,并通过分叉动态验证确认可攻击性。在269份真实合约上使用DeepSeek、GPT和Gemini三种LLM进行测试,平均精确率81.8%,召回率85.4%,显著优于现有工具。
推荐理由:想防智能合约陷阱?这篇论文把隐蔽代币合约的六类套路全解剖了,用三种大模型验证,精确率81.8%,比现有工具强一截。
11:22
11:22官方一手arXiv: DeepSeek@Xin Sun, Daniel Ståhl, Kristian Sandahl, Christoph Kessler
这篇论文通过两个案例研究分析了Claude和DeepSeek的四代模型在SWE-bench Lite上的非功能性质量差异。静态分析显示大多数CodeQL配对差异为零,且无CodeScene比较在Holm校正后显著。CPU时间差异较小且不一致,峰值内存略高但绝对差异很小。整体上,较晚模型解决更多实例,但在共同解决的任务中非功能性指标无一致改进。
推荐理由:这篇研究不只看模型能修复多少问题,还比较了Claude和DeepSeek不同代际的代码质量、CPU时间和内存使用,发现新模型虽修得多但代码质量没明显提升。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。