7月1日
10:08
10:08官方账号arXiv cs.AI@Zhaoyang Luo, Runmin Dong, Miao Yang, Fan Wei, Yushan Lai, Bin Luo, Haohuan Fu
论文提出一种操作级视觉令牌跳过框架,将Transformer层分解为注意力与FFN操作,选择性跳过冗余计算。实验覆盖3种MLLM架构(含Qwen3-VL)和10个VQA基准,实现精度-效率权衡:在Qwen3-VL上减少33.7% TFLOPs,保留99.5%的原始性能。关键发现是晚期视觉令牌更新对答案表示影响很小,且有效计算具有操作主导性和层依赖性。
推荐理由:这篇论文告诉你如何在不牺牲性能的前提下大幅降低多模态大模型的计算量。他们在Qwen3-VL上砍了33.7%的算力,性能只掉了0.5%,方法很巧妙。
09:57
09:57官方账号arXiv cs.LG@Mark Levene, Martyn Harris
该论文研究神经网络对输入值随机噪声扰动的鲁棒性。作者提出一种基于高概率的鲁棒性度量,给出均方误差的上界,且将网络视为黑箱计算。在多个真实数据集上的实验验证了方法的有效性。论文还引入鲁棒性曲线概念,用于分析数据内部和跨数据集的鲁棒性特征。
推荐理由:这篇论文提出了一种计算简单的方法,能告诉你神经网络对输入噪声的容忍上限,还画出了鲁棒性曲线,帮你量化模型稳定性。
09:55
09:55官方账号arXiv cs.LG@Ole Winther, Paul Jeha, Sander Dieleman, Andriy Mnih, Manfred Opper, Andrea Dittadi
这篇论文从变分视角系统介绍了随机微分方程(SDE)在生成机器学习中的应用。它推导了证据下界(ELBO)并作为讨论扩散模型、得分匹配和流匹配的统一框架。论文使用一维密度建模问题比较了不同参数化的效果。
推荐理由:想搞懂扩散模型、得分匹配背后的数学原理?这篇论文从变分角度讲清楚了SDE和ELBO,适合想深入理论的朋友。
09:53
09:53官方账号arXiv cs.LG@Georg Götz, Alessia Milo, Steinar Guðjónsson, Daniel Gert Nielsen, Jesper Pedersen, Finnur Pind
该论文对比了不同精度的房间声学模拟方法对多通道语音增强模型的影响。作者使用SpatialNet在基于几何声学、波动声学及其混合模拟的数据集上训练,并在实测数据上评估。高保真模拟数据集训练出的模型,中位数词错误率相对降低了38%。结果表明,高保真房间声学模拟能直接提升多通道语音增强性能。
推荐理由:这篇论文用实验告诉你,声学模拟精度越高,语音增强效果越好,SpatialNet在实测数据上词错误率降了38%,训练数据质量是关键。
6月30日
15:35
15:35官方账号arXiv cs.LG@Philip Zmushko, Egor Petrov, Nursultan Abdullaev, Mikhail Khrushchev, Samuel Horváth
该研究挑战了异步流水线并行中梯度陈旧导致不稳定的普遍假设。论文发现,在PipeDream-2BW调度下,一步延迟的退化强烈依赖于优化器选择:AdamW遭受严重退化,而Muon表现出强鲁棒性。作者提出了一种优化器无关的Error Feedback修正进一步缓解延迟影响,并在高达10B参数的模型上验证了与同步训练的性能差距已被消除。理论分析证明了Muon在有无修正下的收敛性。
推荐理由:这篇论文用Muon优化器颠覆了'异步流水线并行梯度延迟必然拉胯训练'的老观念,10B参数实验证明性能和同步训练一样好,做大型LLM预训练的同学应该看看。
15:14
15:14官方账号arXiv cs.LG@Mohit Raghavendra, Anisha Gunjal, Aakash Sabharwal, Yunzhong He
SWE-Interact是一个新测试平台,用于评估编码代理在多轮交互、用户驱动的软件工程任务中的表现。现有SWE基准(如SWE-bench)通常预先提供完整需求,而SWE-Interact通过用户模拟器逐步揭示需求、提供反馈和约束。在单轮任务中,最强模型(如Opus 4.8和GPT 5.5)解决率约50%,但在SWE-Interact多轮任务中仅解决约25%。该基准测量了模型在交互目标发现和迭代细化中的正交能力。
事件专题

推荐理由:想知道编程智能体在真实对话开发中能撑多久吗?SWE-Interact测试了Opus 4.8和GPT 5.5在模糊需求下逐步迭代的能力,结果比单轮任务差一半。
13:46
13:46官方账号arXiv cs.AI@Xinlei Yu, Gen Li, Qingyi Si, Guibin Zhang, Yuqi Xu, Congcong Wang, Shuai Dong, Kaiwen Tuo, Xiangyu Zeng, Kaituo Feng, Qunzhong Wang, Yang Shi, Xiaobin Hu, Xiangyu Yue, Jiaqi Wang, Shuicheng Yan
精选
DOPD是一种advantage-aware的双重蒸馏范式,通过动态路由令牌级监督信号,在特权教师和特权学生策略之间进行分配,缓解了传统同策略蒸馏中的特权幻觉问题。实验在LLM(如GPT-2)和VLM(如CLIP)上验证,结果显示DOPD在稳定性和鲁棒性等指标上持续优于Vanilla OPD。
推荐理由:这篇论文提出了一种新蒸馏方法DOPD,通过分令牌监督解决特权幻觉,在LLM和VLM上效果都更好,适合关注模型压缩的研究者。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。