7月27日
10:59
10:59官方账号arXiv cs.LG@Athanasios Papastathopoulos-Katsaros, Steven T. Lee, Lin Yao, Ajay Thomas, Junseok Park, Matthew J. McGinley, Zhandong Liu
论文提出bag-of-waves框架,利用移位不变k-means无监督学习EEG波形模板(原子),将连续信号转为原子序列计数进行分类。方法扩展了原子间转移n-gram和跨通道空间原子。在三个数据集测试:仅16只小鼠的单通道基因型聚类、静息态痴呆分类、以及TUEV临床EEG六分类基准。性能与深度/基础模型相当,但参数量极少且完全可解释——每个原子对应可检验的波形形态,神经生理学家可验证已知临床特征。
推荐理由:这篇论文用了一种叫bag-of-waves的巧办法,只需少量数据就能从脑电信号里学到可解释的波形模板,比那些黑箱深度模型好懂,还省钱省算力。
10:57
10:57官方账号arXiv cs.LG@Ahmed M. Abuzuraiq, Philippe Pasquier
论文提出一种面向创意实践的可解释AI方法,让艺术家能检查、修改和调试扩散模型内部结构。作者在ComfyUI的节点工作流中集成了交互式层选择与干预控件,实现模型弯曲。通过对Stable Diffusion 1.5进行定性与定量分析,发现操纵不同组件(如UNet层)会产生相对一致的视觉效应。该方法帮助艺术家建立层级的直觉,理解模型各部分如何影响生成图像。
推荐理由:这篇论文告诉你,艺术家也能像玩材料一样玩扩散模型内部。他们在ComfyUI做了交互工具,能直接操纵Stable Diffusion的层,看到具体变化。不是理论说教,是真能动手调的。
10:57
10:57官方一手arXiv: DeepSeek@Deyu Yang, Rundong Wei, Xiaoqi Li
该论文提出一种结合漏洞聚焦代码切片、ERC-721 知识库和约束 DeepSeek 的 NFT 智能合约漏洞检测方法。在 450 个 NFT 合约样本上,完整配置的检测器给出了 437 个正标签,正标签率达到 97.1%。去除外部知识库后,正标签率降至 87.11%;进一步去除代码切片,正标签率降至 73.78%。结果表明,聚焦代码上下文和领域约束显著影响检测效果。
推荐理由:研究了一套专门针对 NFT 合约的漏洞检测方法,用 DeepSeek 加代码切片把准确率干到了 97.1%,比纯分析完整合约高了 23 个百分点。做合约安全的可以看看。
10:55
10:55官方一手arXiv: Anthropic@Evan Caville, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann
论文提出SIREN方法,通过PAIR越狱循环自动编辑检索到的网页内容,操纵大语言模型的推荐排名。在124次试验中,SIREN在Claude 3.5 Sonnet和Claude 3 Opus模型上实现62次目标实体升至排名1。使用23种内容投毒技术(如声明性排名声称和种子列表),并在新会话中复现成功率达0.805。这是首个在固定源上下文下研究生产级LLM推荐排名操纵的受控实验。
推荐理由:这篇论文教你如何通过修改网页内容让大模型推荐时把你想要的东西排第一。SIREN用PAIR越狱循环,在Claude模型上成功率80%,挺有意思的。
10:55
10:55官方账号arXiv cs.LG@Yihao Xiao, Jialong Sun, Zitian Gao, Zeming Wei, Chutian Wang, Ran Tao, Jiaye Teng, Bryan Dai
论文分析了Hyperball风格优化器在大规模训练中的优势来源,通过推导角度有效学习率发现径向更新对角度位移影响有限,无法解释MuonH与MuonWD的收敛差异。数值实验表明两者差异主要来自有效步长的演化而非更新方向。预训练实验显示更激进的学习率衰减虽能加速早期训练但可能损害后期性能。代码已开源。
推荐理由:这篇论文把Hyperball优化器的机制拆开来看,发现它并不像传说中那样自动解决学习率调度问题,掌握好调度才是关键。
7月24日
12:04
12:04官方账号arXiv cs.LG@Hongnan Ma, Yiwei Shi, Mengyue Yang, Weiru Liu
TimePNS框架解决了现有充分性导向方法可能将无关子序列误判为重要的问题,该框架采用两阶段设计:阶段I学习因果生成过程和充分性掩码;阶段II通过反事实干预评估时间因子的必要性,并以此监督时间门细化解释。在合成和真实时间序列基准上的实验表明,TimePNS能更准确地识别决策关键子序列,并在充分性-必要性权衡上持续优于强基线方法。
推荐理由:时间序列分类的黑盒解释往往只找够用的特征,但可能抓到噪音。这篇论文提出了TimePNS,用反事实推理揪出真正必要的子序列,实验效果比现有方法好。
12:01
12:01官方一手arXiv: DeepSeek@Lei Zhang, Yusheng Zhao, Yimeng Cao, Ranyiliu Chen, Mingrui Jing, Jizhe Lai, Ziao Tang, Jingu Xie, Hongshun Yao, Xuanqiang Zhao, Guocheng Zhen, Chengkai Zhu, Xin Wang
精选
研究者发布两个 Lean 4 基准:Lean-QuantumAlg-Bench(36 个任务)和 Lean-QIT-Bench(40 个任务),用于评估 AI 在量子算法和量子信息理论上的定理证明能力。在四个模型(GPT-5.5、Kimi K3、DeepSeek V4-Pro、MiniMax M3)中,最高难度加权得分分别为 60.4/100 和 59.6/100。库增强推理(LAD)在所有八个模型-基准对比中均提升得分和完成率,最高提升 15.9 分。模型在量子模拟、量子学习、量子信息度量等领域的证明能力存在薄弱环节。
事件专题

推荐理由:想知道 AI 定理证明在量子计算领域到底多强?这篇论文给了两个新基准和四个模型实测分数,LAD 方法能提升最高 15.9 分,很实在。
11:56
11:56官方账号arXiv cs.LG@Yakun Wang, Leyang Wang, Song Liu, Taiji Suzuki
提出一种基于零流准则的统计差异度量ZFD,并设计零流双样本检验ZF2ST。该方法通过分离证据学习与假设评估,允许使用灵活神经网络进行检验。在合成数据和图像数据集上的实验表明,ZF2ST在检测结构化分布变化时具有强检验功效,同时保持校准的I类错误率。
推荐理由:这篇论文提出了一种能直接用神经网络做双样本检验的新方法,比传统方法更灵活,效果也很好。
11:52
11:52官方账号arXiv cs.LG@Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao
研究提出基于开源LLM的多模态认知障碍检测框架,融合语音音频和转录文本。在ADReSS20和ADReSSo21基准上评估,分类准确率达92.4%。该框架优于单模态基线,并展现出跨数据集泛化能力。无需访问原始敏感数据,保护患者隐私。
推荐理由:这篇论文用开源LLM整合语音和文本,在ADReSS20上准确率92.4%,比只用单一模态强多了,且跨数据库也能用。
11:32
11:32官方账号arXiv cs.AI@Yijun Liang, Yunjie Tian, Yijiang Li, Yuqi Jia, Furong Huang, Tianyi Zhou, Di Fu
VCSD提出一种新的自蒸馏方法,通过对比原始图像和内容擦除控制的token级log概率差异来生成蒸馏信号。在ViRL39K数据集上,基于Qwen3-VL的实验显示,2B模型七基准聚合从62.27%提升至67.04%,4B从71.30%提升至73.16%,8B从72.51%提升至76.26%。VCSD无需外部教师、特权答案或视觉证据信号,且不增加推理开销。
事件专题

推荐理由:这篇论文提出了VCSD,不需要外部老师就能让多模态模型自己教自己,在Qwen3-VL上几个规模都涨了4-5个点,而且不增加推理成本。
11:04
11:04官方一手arXiv: Anthropic@Fred Mesnard, Thierry Marianne, Étienne Payet, Wim Vanhoof
本研究通过提示Claude生成Prolog代码和测试,并使用LPTP进行形式化证明。Claude为前33个P-99问题生成了58个逻辑过程、508个测试和257个引理(共11800行证明)。作者手动检查了所有代码和证明,验证了类型、终止性、唯一性等性质。该实验展示了“vibe-coding/vericoding”方法用于Prolog编程的可能性。
推荐理由:一个用Claude写Prolog代码并用LPTP证明正确性的实验。有具体的数字和流程,适合对LLM+形式化验证感兴趣的人。
10:29
10:29官方账号arXiv cs.AI@Gaurav Dadhich
该论文将AI代理的上下文管理重新定义为生命周期问题,而非简单存储检索。作者提出五原语:架构化、摄取、范围化、预期、压缩与整合。参考实现Maximem Synap在LongMemEval基准上得92%,在LoCoMo上得93.2%。论文还指出现有基准未覆盖延迟、token效率和上下文旋转抗性等维度。
事件专题

推荐理由:这篇论文把AI代理失效的真正原因讲透了——不是推理不行,而是管不住上下文。还给了个参考实现,LongMemEval和LoCoMo成绩都90%以上。
10:19
10:19官方账号arXiv cs.AI@Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao, Zheng Liu, Lei Xiong, Jiahao Wang, Sen Wang, Xiyan Jiang, Wanli Li, Yuyang Hu, Hongjin Qian, Bingyu Yan, Ziyi Xia, Yingxia Shao, Kang Liu, Zhicheng Dou, Di He, Chaozhuo Li, Qiwei Ye, Zhongyuan Wang, Zheng Liu
72°
AREX是一种递归自我改进(RSI)的深度研究代理,设计用于解决需要满足多重约束的复杂检索任务。AREX通过内循环收集证据构建临时答案,外循环逐约束审计答案并启动针对性的后续研究。其核心创新是学习一个自主上下文更新工具,将交互历史压缩为紧凑的改进状态,无需外部模型。AREX在4B密集模型和122B-A10B混合专家模型上实例化,在BrowseComp、WideSearch、DeepSearchQA、HLE等基准上显著优于可比规模基线,与使用更多激活参数的模型竞争。
推荐理由:AREX这篇论文让AI自己递归改进答案,在多个搜索和推理基准上超越了同体量模型,想了解自我优化怎么做可以看看。
09:44
09:44官方账号arXiv cs.AI@Nooshin Maghsoodi, Amoon Jamzad, Robert Policelli, Mohammad Farahmand, Dilakshan Srikanthan, Martin Kaufmann, Kevin Y. M. Ren, Shaila Merchant, Sonal Varma, Ross Walker, Doug McKay, John Rudan, Gabor Fichtinger, Parvin Mousavi
本研究提出Agent-Guided Concept Discovery框架,用于从REIMS质谱数据中学习可解释概念以辅助手术切缘评估。该框架无需预定义概念标签,通过推理代理优化语义描述并利用生化知识图谱确保一致性。在皮肤癌和乳腺癌数据集上,该方法相较于基线提高了平衡准确率和灵敏度。在术中案例中,假阳性更少,表明更好的泛化能力。
推荐理由:这篇论文用智能体自动发现概念,让REIMS数据的手术切缘评估更可解释、更准确,真实术中场景也表现更好。
09:39
09:39官方账号arXiv cs.AI@Mack Nixon, Liam Wright, Yevgeniya Kovalchuk, Alison Fang-Wei Wu, Martin Danka, Andy Boyd, David Bann
研究者提出开源框架RRBench,评估开源权重LLM驱动的AI代理在纵向人口研究数据准备中的效果。框架包括来自英国队列研究6轮数据的真实清洗脚本,以及20个数据准备任务(创建102个变量)。基准测试显示,31-35B参数模型平均任务完成度达87.9%,接近饱和。结果表明,消费级硬件上的开源模型为治理受限研究中的AI辅助数据准备提供了可行路径。
推荐理由:想知道开源模型做数据清洗行不行?这篇论文用真实研究数据测试了31-35B模型,近九成任务都能搞定,隐私保护场景也能用。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。