6月18日
10:57
10:57官方账号arXiv cs.LG@V. Samuel Pérez-Díaz, Vinay L. Kashyap, Joshua D. Ingram, David Fouhey, Juan Rafael Martínez-Galarza, Pavlos Protopapas, Jeremy J. Drake, Dong-Woo Kim, Cecilia Garraffo
研究利用LightGBM梯度提升分类器,对钱德拉源目录(CSC v2.1)约25.4万个X射线源与盖亚DR3光学数据进行交叉匹配。基于贝叶斯框架NWAY构建高质量训练集,利用星等、颜色和距离等特征,识别出约11.3万个对应体,其中约7000个有多个候选。在钱德拉猎户座超深度项目(COUP)上验证,机器学习方法在不使用位置信息时重现了95%的NWAY匹配结果。研究还发现约2万个源虽在空间上匹配但为偶然重合,并发布了对应的目录。
推荐理由:这篇论文教你用机器学习给X射线源找光学配对,比纯靠位置准多了。他们用LightGBM找到了11万多个钱德拉对应体,还公开了目录,做多波段天文的人别错过。
10:57
10:57官方账号arXiv cs.LG@Denis Peskoff, Joe Barrow, Christopher Vu, Diag Davenport
LOCUS是美国首个大规模地方法规语料库,收录9,239个市县的法典。该数据集通过OCR处理了多种文档格式,覆盖3,144个县中的2,309个,覆盖多数美国人口。研究团队训练了基于ModernBERT的分类器,用于分析法规的模糊性和家长主义等维度。LOCUS-v1及其衍生模型已在Hugging Face上开源。
推荐理由:法律AI研究者有福了!LOCUS提供了9,239个美国地方法规的机器可读语料,还附带了基于ModernBERT的分析工具,解决碎片化问题。
10:57
10:57官方账号arXiv cs.LG@Mohamed Nabail, Leo Cheng, Jingmin Wang, Nicholas Rhinehart
UBP2是一种基于模型的偏好强化学习方法,通过联合推理奖励、动态和价值函数的不确定性来主动引导探索。该方法使用集成模型对候选轨迹进行评分,平衡期望奖励、终止价值和认知不确定性。在Meta-World基准测试中,UBP2比无模型的偏好方法和非乐观的基于模型基线实现了更高的样本效率。
推荐理由:UBP2通过主动探索和不确定性平衡,有效解决了偏好强化学习中样本效率低的问题。在Meta-World测试中效果显著。
10:57
10:57官方账号arXiv cs.LG@Amiri Hayes, Belinda Li, Jacob Andreas
研究者提出用程序合成方法反向工程Transformer注意力头。他们先计算注意力矩阵,再让预训练语言模型生成Python程序来重现注意力模式。在GPT-2、TinyLlama-1.1B和Llama-3B上,不到1000个程序实现了平均IoU>75%。替换25%的注意力头仅导致16%的困惑度增加,并在下游问答基准上保持性能。
推荐理由:这篇论文用Python程序解释了注意力头怎么工作,还能直接用程序替换掉原始头,精度很高,想看模型内部机制的可以读。
10:57
10:57官方账号arXiv cs.LG@Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin, Nikita Kurlaev, Daria Pugacheva, Albina Burlova, Mikhail Kolosov, Denis Shepelev, Andrey Kuznetsov, Elena Tutubalina, Aleksandr I. Panov, Alexey K. Kovalev, Vlad Shakhuro
论文提出 Act2Answer 协议,通过让智能体在桌面场景中执行物体放置动作来选择答案,从而在动作层面评估 7 个 VLA 模型和 9 个 VLM 基线在常识与知识任务上的表现。研究发现,VLA 在简单概念上表现扎实,但在丰富语义类别上相比源 VLM 出现更大差距。实验还表明,VQA 联合训练有助于提升知识保留,而答案相关信息在 VLA 中层达到峰值,上层则衰减。
推荐理由:想知道微调后的机器人模型到底还记不记得常识?这篇论文用动作答题的方式测了7个VLA,发现简单概念还行,复杂知识掉得厉害。
10:57
10:57官方账号arXiv cs.LG@Jiaqing Zhang, Sabyasachi Bandyopadhyay, Miguel Contreras, Jessica Sena, Yuanfang Ren, Andrea Davidson, Ziyuan Guan, Tezcan Ozrazgat-Baslanti, Subhash Nerella, Azra Bihorac, Parisa Rashidi
该研究探讨环境声音和光照强度能否独立预测ICU谵妄。基于9个ICU的309名患者数据,评估了四种高效序贯神经网络模型在10个预测窗口上的表现。卷积模型在声音数据上取得最强辨别能力,AUC达0.80。结合声音与光照可改善短期(<1周)预测,模型在感知期结束后立即分配最高风险。
推荐理由:这篇论文发现ICU里的环境声音比光照更能预测谵妄,卷积模型AUC达到0.80,为无创预警提供了新思路。
10:56
10:56官方账号arXiv cs.LG@Bartłomiej Baranowski, Dave Zhenyu Chen, Matthias Nießner
OneCanvas将多视角patch特征投影到等距柱状全景画布,并添加3D坐标的位置嵌入。无需复杂几何编码器或大量训练预算。在SQA3D和VSI-Bench上达到SOTA准确率,在SPBench上泛化到分布外数据。训练计算量比最强竞争方法少一个数量级。
推荐理由:OneCanvas用全景投影做3D理解,训练少10倍,在SQA3D上SOTA,适合机器人和具身AI。
10:47
10:47官方账号arXiv cs.AI@Giuseppe Gabriele, Fabio Pavirani, Seyed Soroush Karimi Madahi, Chris Develder
一篇论文提出决策聚焦强化学习(DF-RL)框架,用于控制电动汽车充电,解决未知离开时间问题。该方法将预测器与充电策略进行端到端联合训练,相比不使用离开时间预测的RL方法,总奖励提升14%,未供应能量(因车辆提前离开导致充电失败)减少55%。实验基于历史数据模拟,验证了在不确定性下充电决策质量的改善。
推荐理由:这个论文搞了个新训练方式,让预测器和充电策略一起优化,结果充电失败少了一半多,值得做RL调度的看看。
10:43
10:43官方账号arXiv cs.AI@Depen Morwani, Alexandru Meterez, Pranav Nair, Sham Kakade
精选
该论文研究了随机重球法(HB)和加速SGD(ASGD)在一致线性回归中的计算效率与串行运行时间权衡。结果表明HB在任意谱下无法超越SGD的计算效率前沿,但允许在比SGD临界批量大sqrtκ倍的窗口内减少串行运行时间。ASGD在快速衰减幂律谱下可提升小批量计算效率,但随着批量增大,牺牲效率换取更优串行时间。合成线性回归实验验证了这些定性规律。
推荐理由:这篇论文把HB和ASGD在批量大小上的效率权衡讲清楚了,特别是那个sqrtκ倍的窗口,对想用动量方法加速训练的人很有参考价值。
10:39
10:39官方账号arXiv cs.LG@Till Richter, Niki Kilbertus
OrthoReg提出了一种正交正则化方法,直接惩罚符号组件与神经组件的重叠,防止符号结构被神经残差吸收。相比标准L2正则化,该方法在符号组件通过稀疏发现学习时仍能保持互补分解。在部分库不匹配的基准动力系统上,OrthoReg改善了符号恢复准确性和分布外泛化性能。
推荐理由:这篇论文提出OrthoReg,解决了混合建模中神经网络容易学走符号部分的问题,实验效果明显,写代码的朋友可以看看。
10:36
10:36官方账号arXiv cs.LG@Arnaud Lequen, Clément Legrand-Lixon, Léo Saulières
PQLRM算法将Pareto Q-Learning与奖励机器(Reward Machines)结合,维护向量化Q估计来逼近Pareto前沿。实验表明,相比朴素PQL基线,PQLRM在奖励机器编码的非马尔可夫任务中收敛更快。它还能合成QRM无法获得的Pareto最优策略,提升了多目标强化学习的样本效率。
推荐理由:这篇论文提出了PQLRM,把Pareto Q-Learning和奖励机器结合起来,在多目标任务里比基线收敛更快,还能找到普通方法找不到的最优策略。
10:32
10:32官方账号arXiv cs.LG@Yiyan Huang, Cheuk Hang Leung, Qi Wu, Zhiheng Zhang
该论文研究离线策略学习中结果变量为分布的情况,将每个潜在结果视为概率测度,并通过 Wasserstein 重心下的效用函数定义奖励。论文基于 IPW 和 Doubly Robust 估计量建立了统计保证,证明了有限样本后悔率的领先项为 O~(√(N-dim(Π)/N))。在一维 Wasserstein 设定下,后悔率仍由策略类复杂度主导。另外提供了极小化下界,证明了对 N 和 N-dim(Π) 的领先依赖的紧致性。
推荐理由:这篇论文把因果推断中的离线策略学习扩展到了分布结果,用Wasserstein重心定义奖励,并给出了严格的统计保证,和传统均值策略学习不同,适合做理论研究的参考。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。