8月7日
12:37
12:37官方账号arXiv cs.LG@Xian Sun, Wei Chow, Yingshuo Wang, Junhao Liu, Wei Gao, Qing Wu, Lingdong Kong
论文提出MIST基准,将每道推理题置于干净、误导、正确上下文、无关上下文四种条件下。配套SC2W指标衡量误导信号使原本正确答案变错的频率。作者发现该脆弱性在多种开源模型上普遍存在。提出的SCOPE方法通过匹配偏好对优化DPO目标,在保持干净上下文准确率的同时显著降低SC2W。
推荐理由:这篇论文把“信不信上下文”当成独立问题来训练,用MIST测出模型容易被一条错误信息带偏,SCOPE能减少这种翻车还不影响正常表现。
12:36
12:36官方账号arXiv cs.LG@Soorya Ram Shimgekar, Michelle Hu, Dorisa Shehi, Daniel Kang, Roy Ka-Wei Lee, Koustuv Saha, Christian Poellabauer, Christopher Lee, Sajeev Singh, Piyum Zonooz, Navin Kumar, Zeeshan Ahmed, Priyadarshini Kachroo
电子病历特征工程占数据科学家39%-45%工作量,心衰领域尤其棘手。研究者提出Nimblemind多智能体系统(nMAS),在500份模拟患者记录、9张EHR源表上生成132个结构化特征和70个评分聚合特征。加入聚合特征后,HFrEF分型的held-out AUROC从0.895升至0.963,HFpEF从0.870升至0.910。独立LLM对证据支撑与方法学评分为最高分的81.5%。
推荐理由:心衰数据特征工程又慢又容易出错,nMAS自动管线把HFrEF的AUROC拉到0.963,还能审计特征来源。
12:30
12:30官方账号arXiv cs.LG@Chenglong Wang, Ziming Zhu, Yifu Huo, Bei Li, Qiaozhi He, Yan Ding, Xiaoyang Hao, Yuxin Gao, Tianhua Zhou, Xiaojia Chang, Tongran Liu, Jingbo Zhu
生成式奖励模型在响应排序上表现出色,但其比较性输出与强化学习要求的标量奖励不匹配。为此论文提出 RRC(Ranking-based Reward Construction),通过相对偏好排序构造奖励信号。RRC 包含自竞争排序和锚定引导排序两种互补策略,分别利用采样响应间的比较和小规模参考响应实现可扩展构造。实验在开放对话和推理基准上验证,RRC 相比现有方法持续提升强化学习训练效果。
推荐理由:这篇论文提出 RRC,能把生成式奖励模型的排序结果转成强化学习能用的信号,在对话和推理任务上比现有方法更稳定地提升训练效果。
12:09
12:09官方账号arXiv cs.AI@Sarvesh Baskar, Zikui Cai, Shayan Shabihi, Anirudh Satheesh, Muhammad R. Islam, Udari Madhushani Sehwag, Tom Goldstein, Furong Huang
新论文提出trace-grounded参数化测试方法,在2,190个视频上审计事件计数能力。Gemini 3.6 Flash在80%可靠性阈值下最多可靠计数12个持续状态转换事件(0.5和1.0 Hz),对瞬时闪烁事件则无可靠计数区间。高计数高频率场景下仅0.2%的最终计数正确,模型只能恢复18.1%的真实事件。提高采样率将Bounce Ball准确率从19.6%提升至29.3%,但报告序列与真值一致率仅3.7%。
事件专题

推荐理由:用可执行真值逐帧审计视频模型计数,发现Gemini 3.6 Flash处理瞬时事件几乎失效,加帧只虚涨分数,值得看。
12:06
12:06官方账号arXiv cs.AI@Yunjia Qi, Zehua Yin, Xintong Shi, Hao Peng, Songyuanyi Lu, Yixian Liu, Richeng Xuan, Yuhong Liu, Zhichao Hu, Xiaozhi Wang, Lei Hou, Bin Xu, Juanzi Li
TrajDebug提出错误生命周期追踪框架,通过多粒度历史压缩和基于证据的错误识别,解决长轨迹中的错误发现难题。该框架追踪每个错误的解决状态和终端影响,实现关键归因。研究构建了TrajErrBench基准,包含来自Tau2Bench和SWE-Bench Pro的486个手动标注失败轨迹。实验表明TrajDebug在多个智能体基准上优于现有基线,其诊断结果可提升下游智能体成功率。
推荐理由:TrajDebug能从长轨迹里精准揪出导致最终失败的那个错误,486条真实数据验证过,比现有方法都靠谱。
11:39
11:39官方账号arXiv cs.AI@Mutasim Fuad Sarker, Adiba Rahman Namira, Wafa Binte Alam, Md Adnan Arefeen, Mahzabeen Emu, Sumaiya Tabassum Nimi
QuanTiMedAI结合智能体LLM与量子循环网络,构建心脏骤停死亡风险预测模型。在MIMIC-IV心脏骤停队列上,模型仅用605个参数达到AUROC 0.852,较当前最先进基线提升约2.9%。智能体LLM引导的特征选择优于传统方法,量子非线性增强则让模型以极少参数取得竞争力。
推荐理由:这个QuanTiMedAI挺有戏:605个参数就把心脏骤停死亡预测AUROC做到0.852,比原来最好的还高2.9%。
10:11
10:11官方账号arXiv cs.LG@Omid Bazgir, Md Nasir, Jacob Hoffman, Yang Yang, Manu Agrawal, Anusua Trivedi, Vinay Rao Dandin, Chris Gibbons, Christine Swisher
论文提出在效用约束下改进合成临床基准的真实性。基线基准的配对缺失率达79.44%,仅12.75%的行可操作,38.94%的患者无可操作指标。两种确定性修订方案在保持效用下限的同时改善了上述指标。与朴素加密控制相比,修订避免了不现实的模板化。研究还发现内部真实性与对聚合操作参考的源保真度是不同目标。
推荐理由:这篇论文教你如何不让合成临床数据看起来像模板:两个修订方法在保住效用下限的同时把真实感拉上来,适合做医疗AI基准的人参考。
09:55
09:55官方账号arXiv cs.LG@Mikhail Solonko, Molozhavenko Alexander, Maxim Rakhuba
Muon是一种矩阵感知优化方法,用于Stiefel流形(正交列矩阵集合)上的优化。以往将Muon扩展到该流形的做法依赖启发式或迭代近似。新论文证明Stiefel Muon更新存在精确闭式解,并据此实现高效算法Skewon。Skewon在平滑非凸条件下具有一阶收敛保证。
推荐理由:Muon在矩阵优化里挺火,但上Stiefel流形一直靠近似。这篇论文给了精确闭式解,还做了个Skewon,收敛性有保障,做正交约束优化的值得看。
09:54
09:54官方账号arXiv cs.LG@Zhiyan Hou, Dan Zhang, Tao Feng, Liyuan Wang, Wei Li, Xiangzhao Hao, Hongyan An, Junfeng Fang, Haokai Ma, Zhaohui Xu, Haiyun Guo, Jinqiao Wang, Tat-Seng Chua
该论文从When、How、Where三个维度梳理持续学习(CL)的演进,指出其正从参数中心学习转向系统级适应。How维度涵盖off-policy、on-policy及超越梯度的优化机制;When维度横跨预训练、后训练与推理时阶段;Where维度区分内部参数更新与外部结构约束。论文系统综述了代表性方法,并讨论了这一范式转变的关键挑战与未来方向。
推荐理由:这篇论文把持续学习的新玩法梳理清楚了,不再只盯着参数调整,连测试时训练、外部记忆都算进去了。搞AI系统的可以看看。
09:40
09:40官方账号arXiv cs.AI@Jia Xiong, Runkai Li, Chenxu Niu, Guangyuan Gao, Changwen Xing, Yifan Zhang, Xinlai Wan, Jieran Cui, Chen Bai, Yusheng Hua, Ying Wang, Ming Ling, Xi Wang, Tao Xie
论文提出MicroEvo框架,将现成LLM与蒙特卡洛树搜索(MCTS)结合用于多目标微架构优化。该框架包含LLM驱动的进化算子、Pareto感知树策略、主动知识积累机制和状态感知指令。实验显示,MicroEvo相比NSGA-II将Pareto前沿质量最高提升36.2%,搜索效率提升10.6倍。该方法在复杂工业级核心上展现出强可扩展性,代码已在GitHub开源。
推荐理由:MicroEvo用LLM引导芯片微架构设计搜索,比NSGA-II质量高36.2%,效率提升10倍多,代码已开源。
09:36
09:34
09:34官方账号arXiv cs.LG@Quentin Luquet de Saint-Germain, Massil Ait Abdeslam, Jean Pierre David
该方法利用训练集上累积和的分布,在累加过程中提前预测最终符号。在VGG11应用于CIFAR-10时,最深层卷积可去除86.6%的累加项,精度仅下降0.37个百分点。同时作用于三个最深卷积时,减少全网络25%的算术操作,精度下降1.36个百分点。全程无需重新训练模型参数。
推荐理由:这篇论文提出一个后训练技巧,能在二值网络里提前跳过大量累加计算,VGG11在CIFAR-10上最多省86.6%运算,精度损失很小。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。