8月5日
12:09
12:09官方账号arXiv cs.LG@Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Samandar, Debargha Ganguly, Sreehari Sankar, Yanyan Zhang, Shouren Wang, Jerry Peng, Biyao Zhang, Michael Hinczewski, Vipin Chaudhary
这篇论文将测试时缩放形式化为自回归模型隐式前缀树上的预算推理,区分单轨迹连续缩放、叶级缩放和前缀级缩放三种结构。论文提出评估轮廓,将端到端系统性能与候选库诊断分离,并指定推理协议的可重复性要求,区分精确重放与分布可复现。作者在广泛知识、符号推理和竞赛数学基准上应用这些原则,并组装了超过20亿条完整推理轨迹供发布。
推荐理由:这篇论文把测试时缩放拆成三种结构,还给了评估和复现规范,做推理模型的人可以参考。
11:59
11:59官方账号arXiv cs.LG@Bartolo Dazzini, Giovanni Conforti, Alain Durmus, Aram-Alexandre Pooladian
arXiv 新论文提出轨迹推断算法 Acceleration Matching (AM)。AM 将插值问题提升到相空间,学习条件加速度场来生成平滑轨迹。训练过程只用位置数据,免去轨迹模拟和昂贵预处理。在文献中的多个基准问题上,AM 达到与现有算法相当或更优的表现。
推荐理由:论文提出了AM算法做轨迹推断,不用模拟轨迹,训练只要位置数据,比现有方法省算力。
11:46
11:46官方账号arXiv cs.LG@Tianyi Guan, Yiding Wang, Haotong Yang, Siyuan Cao, Shirui Liu, Yi Hu, Jiaqi Li, Muhan Zhang
新基准 ContinualSkillBench 用于评估智能体的持续技能学习,覆盖五个领域、100 个按难度递增且可复用技能的互联子任务。实验表明序列执行总体能提升性能,但收益因模型和领域而异。上下文学习与显式技能维护平均表现相当,显式技能只在需要可复用流程或精确输出的任务上更有优势。较弱模型反而会积累更大、更碎片化的任务技能集合。
推荐理由:这篇论文给了一套测试方法,来验证 LLM 智能体到底会不会把经验变成可复用的技能,而不是光靠记住上下文。
11:45
11:45官方账号arXiv cs.LG@Abhinav Thorat, Ravi Kumar Kolla, Vishak K Bhat, Harsh Vardhan Singh Chauhan, Niranjan Pedanekar
GENESIS是一个可解释的混合因果发现框架,将图构建分解为可解释的决策点。它先识别并评分三元结构(链、叉、对撞)作为透明先验,再结合观测证据逐步精化图,仅在统计证据不足时调用领域知识。实验显示,GENESIS在所有设置中实现100%的决策可追溯性,并在多数基准数据集上以结构汉明距离(SHD)优于纯统计方法,性能与最先进的LLM辅助方法相当。
推荐理由:这篇论文提出了GENESIS,让因果发现的每条边都能说清是统计证据还是领域知识,还保证100%可追溯,比纯统计方法更准。
11:41
11:41官方账号arXiv cs.AI@Mercy Prasanna Ranjit, Anirban Porya, Sathvik Joel, Niharika Vadlamudi, Nikhilesh Chowdary Eathamukkala, Prasanth V, Abhyuday Kumara Swamy, Pranay Narhari Umredkar, Pradeep Narayan, Vivek Rajagopal, Tanuja Ganu
CARE-X 在生成骨干网络上增加焦损失分类与复合损失定位头,与语言建模目标联合训练,使胸片报告生成、发现分类和空间定位互相增强。配合任务级奖励优化的 DAPO 策略,该方法在四个报告生成基准的大部分指标上达到最优,ReXVQA 视觉问答准确率 94.0%,比次优基线高 6.0 个百分点。此外,将 Qwen3-VL-4B-Instruct 与可调用确定性测量工具的原生工具能力结合,在五个依赖测量的诊断场景中平均 F1 比仅靠感知的基线高 43.6 个百分点。
推荐理由:医学影像领域的小伙伴可以看看这篇,CARE-X 把胸片分类、定位、报告生成整合到一个模型里,还靠工具调用做解剖测量,临床实用性比纯生成模型强不少。
11:38
11:38官方账号arXiv cs.AI@Dongjie Yang, Siyan Lin, Leixian Shen, Rui Sheng, Huamin Qu, Zixin Chen
论文提出TACT框架,用于训练和评估教学自适应的英语辅导模型。该框架包含13种辅导策略的Tutor-Strategy分类法和描述学生行为的Student-Move分类法。基于两套分类法构建的TACTCorpus覆盖260段师生对话,含32,379条标注。后训练的TACTutor在TACTBench(78个场景)上比基座模型Qwen3.5-4B提升20.30%,并在50名学习者的盲测中获得最高评分。
推荐理由:这篇论文把教学策略拆成13种,用260段真实对话和3.2万条标注训练出TACTutor,在78个测试场景比基座涨了20%,盲测还赢过商业模型。
11:26
11:26官方账号arXiv cs.AI@Shaofeng Liang, Runwei Guan, Wenshuo Chen, Jiemin Wu, Bowen Tian, Haozhe Jia, Kaishen Yuan, Songning Lai, Daizong Liu, Yutao Yue
自适应Transformer跟踪器通过动态路由平衡精度与效率,但其层跳变决策边界的Lipschitz常数无界,微小输入扰动即可被门控模块放大,导致推理拓扑剧变。该研究将这一奇异性确认为可被直接利用的攻击面,并提出对抗路径反转(API)框架。API通过微扰精确操纵门控决策,迫使模型走改变后的计算路径。在最新自适应跟踪器上的实验显示,API在扰动隐蔽性、攻击有效性和推理速度上均更优。
推荐理由:这篇论文发现自适应无人机跟踪器的动态路由能被人用微小噪声劫持,让跟踪跑偏。攻击比现有方法更隐蔽、更快。
11:22
11:22官方账号arXiv cs.LG@Congwei Song
这篇 arXiv 2608.03706 论文面向统计学习初学者,梳理了经典统计学习模型与常见算法。作者用范畴论语言重新描述这些模型,尝试为它们提供统一的构造视角。文章目标是吸引基础数学等领域的研究者参与统计学习相关课题。
推荐理由:这篇用范畴论重讲统计学习模型,少见。适合数学背景的人看,能帮你找到跟机器学习研究接头的入口。
11:17
11:17官方账号arXiv cs.LG@Nelson Aloysio Reis de Almeida Passos, Emanuele Carlini, Salvatore Trani
该研究在NVIDIA RAPIDS生态上扩展谱聚类与模块度算法,支持快照式动态图的社区检测。通过Leiden贪心优化和Bethe-Hessian算子的特征分解,实现多GPU并行处理。在等计算量预算下,多切片模块度后端相对CPU参考实现最高加速约三个数量级。代码已开源,并提供NetworkX-Temporal库的Python绑定,实现零代码加速现有流程。
事件专题

推荐理由:NVIDIA把动态图聚类搬到GPU上了,用cuGraph在RAPIDS里跑,比CPU快上千倍,还开源,搞网络分析的直接能上手。
11:08
11:08官方账号arXiv cs.AI@Tong Ling, Hang Lei, Feng Xiao, Changhui Sun, Jiahang Xie, Hao Liu, Lu Liu, Yanlong Du
MDLMPE 将掩码扩散模型中 token 的可见/掩码状态编码为二进制序列,结合高斯权重与余弦基投影生成位置特征,再经轻量 MLP 映射为角度偏移来调制 RoPE 相位。在 LLaDA 和 DREAM 上的实验覆盖监督微调、预训练、零样本评测和块扩散设置,整体优于传统位置编码。消融实验表明,可用性状态、高斯局部性、频谱基与嵌入注入的组合效果最强。
推荐理由:掩码扩散模型的位置编码一直照搬自回归那套,MDLMPE 第一个把遮盖状态算进去,在 LLaDA 和 DREAM 上效果更好。
11:05
11:05官方账号arXiv cs.AI@Sebastián Andrés Cajas Ordóñez, Agastya Munnangi, Aldo Marzullo, Felipe Ocampo Osorio, Quang Bui, Mohammad Shahin, Armaan Grewal, Emmanuel Paul Kwesiga, Anqi Peter Li, Josephine Nanyonjo, Aaditya Panchal, Arshnoor Bhutani, Nikhil Jaiswal, Milit S. Patel, Maximin Lange, Leo Anthony Celi
一项研究测试了临床多智能体委员会是否会被捷径欺骗,覆盖文本、影像和ICU表格七组队列。在MedQA-USMLE等六个数据集上,Gemini委员会单独面对误导线索时仅有5-16%的翻转率,但两个同伴给出同一错误答案时,holdout模型在38%案例中采纳。三种监督智能体中,gate的假阳性率达100%,同源judge在文本上精确率100%但在影像上失效,而独立referee在影像上取得77-88%精确率。研究还发现,视觉显著性提高三倍不增加传染,但第二个同伴声音使传染率提高一半。
推荐理由:Gemini多智能体会被同伴错误带偏(38%案例),独立裁判能抓,门控不行,做临床AI的注意了。
11:05
11:05官方账号arXiv cs.AI@Chao Peng, Ruida Hu, Ajitha Rajan, Tegawendé F Bissyandé, Jacques Klein, Cuiyun Gao
论文调研了197个真实TUI应用,发现仅12%的测试代码涉及界面,其中45%从不发送输入。作者将ratatui/Rust、bubbletea/Go、textual/Python、ink/TypeScript应用打包成无头基准,对比4个前沿LLM与随机探索。在相同时间预算下,随机探索是强基线,但每次交互LLM引导更高效,且能独特到达需要输入触发的故障。自动派生启动输入带来最大实际收益,使原本无法启动的应用得以运行。行覆盖率无法有效预测崩溃发现,说明它不宜作为测试有效性的代理指标。
事件专题

推荐理由:这篇论文把197个终端界面应用打包成基准,拿4个大模型和随机点击对比,发现随机探索还挺能打,但大模型单次操作效率更高。他们开源了tuicov和tuibot,想测TUI的可以试试。
11:03
11:03官方账号arXiv cs.AI@Sandy Abdo, Bill Kapralos, Priyamvada Tripathi, KC Collins, Adam Dubrowski
这篇综述从Google Scholar、IEEE Xplore和ACM数字图书馆筛选了30篇同行评审文章,系统梳理了文本、视觉、音频和多模态输入对生成音效质量的影响。过去五年中,多个生成模型在语义对齐和时间连贯性上达到SOTA水平。但复杂多事件场景的时序同步仍是难点,客观指标与人类感知存在差距,可控性和生成多样性之间也有权衡。
推荐理由:想了解AI怎么根据文字或画面生成音效?这篇综述把近五年的模型都梳理了一遍,还点出了哪些任务还没做好,适合做声音设计的人参考。
11:00
11:00官方账号arXiv cs.AI@Chunyang Jiang, Pingping Zhang, Yuzhi Zhao, Wenao Ma, Zhijian Hou, Mengyang Wu, Yiyang Cai, Senkang Hu, Sitong Cheng, Chi-Min Chan, Wei Xue, Yike Guo
FISA 框架从模型自身的失败案例中生成增强图像,避免使用与模型短板脱节的通用变换。该方法通过自检验和双重保真过滤,在保持答案正确的同时提升图像复杂度。在视觉问答基准上的实验表明,FISA 能持续改进分布内与分布外性能,并与现有文本自增强方法兼容。其合成样本的数据效率也优于通用图像增强基线。
推荐理由:这篇讲FISA,拿模型答错的题来造新训练图,比瞎做增强更准,还能和文本增强一起用。
10:57
10:57官方账号arXiv cs.AI@Yujia Hu, Tuan-Phong Nguyen, Simon Razniewski
GPTKB 2.0提出一种从LLM直接构建知识库的方法,无需依赖维基百科等外部资源。该方法在生成过程中实时消解实体、关系和类的歧义,兼顾规模与准确率。最终产出的知识库包含超过100万个消歧实体和3840万个三元组,是首个达到百万规模的LLM原生知识库。项目已开放,可在gptkb.org获取。
推荐理由:想从LLM直接抽知识库?这篇论文给了一套实时消歧方案,产出了百万实体和3800多万三元组,跟以前维基系的做法很不一样。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。