7月17日
09:53
09:53官方账号arXiv cs.AI@Emmanuel Jeannot
这篇论文提出,AI正从工具变成研究中的自主参与者,标志着科研从手工艺模式转向流水线模式。以美国能源部的Genesis项目为案例,讨论了七个关键问题:科学能力代际传承的侵蚀、AI生成理论的不透明性、同行评议被机器产出淹没问题等。作者指出这些不是反对AI科学,而是负责任发展的条件。
推荐理由:这篇论文分析了AI如何把科研从手工艺变成流水线,还举了Genesis项目的例子,提出了七个扎心问题,比如同行评议会不会被机器淹没,读了对AI和科学的关系会有新认识。
09:52
09:52官方账号arXiv cs.AI@Weishuai Zeng, Kangning Yin, Xiaojie Niu, Shunlin Lu, Weixiang Zhong, Jiahe Chen, Feiyu Jia, Xiao Chen, Zirui Wang, Furui Xu, Ming Zhou, Kailin Li, Weinan Zhang, He Wang, Li Yi, Dahua Lin, Jiangmiao Pang, Jingbo Wang
72°
该论文提出行为基础模型(BFM)的缩放配方,核心包括运动跟踪学习范式、策略同步量与参考动作多样性的协同、以及可扩展的Humanoid Transformer架构。在仿真和真实世界部署中,Humanoid Transformer将局部模式下的平均关键点位置误差(MPKPE)降低10%以上,全局模式下降低82%。相比现有仿人控制器,该方法显著提升了控制保真度和任务泛化能力。论文验证了BFM作为通用仿人控制基础的有效性。
推荐理由:这篇论文把仿人机器人控制的缩放问题拆解清楚了:Humanoid Transformer配合特定训练范式,让MPKPE直接降了82%,比现有控制器强一大截。
09:50
09:38
09:38官方账号arXiv cs.AI@Haoxuan Li, Tianci Gao, Jianhe Li, Yang Fan, Runze Shi, Weiran Wang, Tianxiang Zhao, Zezhao Wu, Xiaoyang Jiang, Qihui Zhang, Jia Li, Xiao Xiao, Kai Du, Xiaoxuan Jia, Chao Xie, Lu Mi
BrainPilot 是一个完全开源的多智能体系统,旨在自动化脑科学发现过程。该系统包含一个统一脑科学知识库(7233个索引条目)和技能库(72个可复用方法单元),覆盖七个研究领域。每个步骤记录在Graph of Trace中,提供可审计的日志,同时Auditor agent负责检查编造内容。在Agents' Last Exam的三个脑科学任务及自建基准BrainPilotBench-v0上,BrainPilot使用开源骨干模型达到与SOTA框架相当的性能,且成本更低。
推荐理由:脑科学研究有多繁琐你懂的,BrainPilot开源出来帮你自动查文献、做分析、防编造,性能不输顶级框架还省钱。
09:35
09:35官方账号arXiv cs.AI@Sofi Gjing Jovanovska, Kuntal Ghosh, Daniel Muhu Njenga, Ahmed Mufassir, Shadan Sadeghian
论文提出ArtSplit原型工具,明确量化人类与AI在创意工作不同阶段的贡献。通过实验收集艺术家对所有权量化的反应,发现量化方法难以匹配艺术家对创意意图的理解。研究指出,将所有权简化为可测量指标会削弱传统艺术创作观念。作者呼吁不应将历史社会关系转化为技术问题。
推荐理由:这篇论文提出了一个叫ArtSplit的讨论工具,帮你理解AI协作创作时所有权到底该归谁,跟艺术家们聊了聊,发现简单量化行不通。
09:25
09:25官方账号arXiv cs.LG@Sara Ketabi, Matthias W. Wagner, Cynthia Hawkins, Uri Tabori, Birgit Betina Ertl-Wagner, Farzad Khalvati
该论文提出MseaCL框架,在儿科3D脑部MRI和放射学报告的多模态对比学习中,通过语义相似性引导减少假阴性样本。传统对比学习将非配对样本视为负例,但医学影像中语义相似的样本常被误判为负例。MseaCL在儿科队列上训练,将报告语义相似度作为信号,下游任务中儿科脑肿瘤分子分类AUC提升至少22.6%。
推荐理由:新论文用语义感知对比学习解决医学影像的假阴性问题,在脑肿瘤分类上AUC涨了22.6%,值得搞多模态医疗AI的人看看。
09:22
09:22官方账号arXiv cs.LG@Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng Jin
LongStraw 是一种针对百万token级别强化学习后训练的架构感知执行栈,基于 GRPO 实现,在固定 GPU 预算下运行。它通过共享提示无自动求导评估、仅保留模型特定状态并逐次重放短响应分支,将实时训练图缩小以换取重放时间。在 8 块 H20 GPU 上,LongStraw 完成了 2.1M 位置的分组 Qwen 评分和响应反向传播;分组数从 2 增至 8 时,峰值显存仅增加 0.21 GB。在 32 块 H20 GPU 上,端到端执行路径验证了 GLM-5.2 全部 78 层的 2.1M token 提示处理能力。这些实验证明了执行容量,但完整训练正确性尚未全面验证。
推荐理由:LongStraw 能让你在固定 GPU 预算下做百万 token 级别的强化学习后训练,比现有 256K 的方法多处理 8 倍上下文,而且内存增长极低。
7月16日
11:35
11:35官方账号arXiv cs.LG@Ximeng Mao, Nanda H. Krishna, Avery Hee-Woon Ryoo, Matthew G. Perich, Guillaume Lajoie
MOJO(Masked autOencoder-based JOint training)是一个结合自监督掩码自编码与监督学习的训练框架,用于尖峰令牌化模型。在猴子运动皮层、小鼠视觉决策等多区域数据集上,MOJO超越纯监督模型,尤其在少样本微调时性能提升显著。该框架还泛化到人类ECoG语音数据,达到专用神经基础模型水平。
推荐理由:MOJO让神经解码模型也能用大量无标签数据,比纯监督学习更强,尤其数据少时效果拔群。
11:31
11:31官方一手arXiv: OpenAI@Minh Hua, Rita Raley
2019年OpenAI发布两百万GPT-2输出以检测机器生成文本,但这些输出不完整且含语法错误。论文认为当前对齐技术(损失函数、奖励模型、基准测试)只是优化文化的最新表现,无法区分低概率文本是错误还是创新。批评者指出这种优化范式在五年内取得了合法语言的裁判权,却缺乏判断力。
事件专题

推荐理由:这篇论文点出了一个关键问题:AI生成文本的优化可能走偏了,不只是工程进步,还牵扯价值观判断。适合想理解技术背后隐患的人。
11:30
11:30官方账号arXiv cs.LG@Jeremy Guntoro, Alexander Dack, Dylan Danno, Michaela Jančovičová, Križan Jurinović, Vanessa Smilansky
该研究使用Evo 2模型第26层激活训练线性及注意力探针,检测宏基因组中抗菌素耐药性(AMR)。线性探针区域级ROC-AUC达0.888,单头注意力探针升至0.977。探针能区分AMR药物子类别,细菌毒力检测较弱(区域级ROC-AUC 0.833)。在模拟短读上无需重训练即达0.898的ROC-AUC。稀疏自编码器分析不如监督探针一致。
推荐理由:这篇论文用Evo 2搞生物安全筛查,探针测耐药基因最高准到0.977,比自编码器靠谱还不用重训练。
10:40
10:40官方账号arXiv cs.AI@Hefeng Zhou, Jinxuan Zhang, Jiong Lou, Yuxin Liu, Chaochao Lu, Jingjing Qu, Jie Li
Deep Interaction 是一种针对大推理模型的人机交互方法,允许用户直接编辑 Chain-of-Thought (CoT) 推理中的错误步骤。该方法将编辑后的 CoT 精炼为蒸馏提示,引导模型沿校正路径推理。在 STEM 任务上,纠正成功率提升超过 25%,token 使用减少约 40%。实验基于多个 STEM 推理基准,展示了显著的效率提升。
推荐理由:这篇论文提出 Deep Interaction,让你可以直接改推理步骤的错误,不用推倒重来。实验说 STEM 任务上纠错成功率涨 25%,token 还省 40%,挺实用的方法。
10:39
10:39官方账号arXiv cs.AI@Xanthi Kokkinou, Chaido Mizeli, Nafsika Koulaxidou, Marina Delianidi, Konstantinos Diamantaras
Earthquaker-AI是一种结合检索增强生成(RAG)和基于量规评估的混合教育框架,面向小学生地震应对教育。它基于Lego WeDo2机器人模拟地震响应,并通过RAG系统匹配官方指南生成安全回复。实验评估显示其高准确率和低幻觉率,量规从二维到四维渐进适应不同年级认知水平。该框架将动手实践与认知反思结合,提升技术素养和应急能力。
推荐理由:这篇论文把RAG和量规评分用在地震教育里,还搭了乐高机器人,让小学生边玩边学安全知识,挺实际的新方法。
10:38
10:38官方账号arXiv cs.AI@Tam Nguyen, Hung Nguyen, Robert Ogburn
该论文提出一个AI加速的端到端框架,覆盖知识获取、内容开发、审核、教学与评估五个阶段。美国国家会计委员会已批准基于该框架的继续教育学分项目。3名学习者借助该框架在短时间内通过NVIDIA认证专家考试。框架的知识库还生成了1267条多智能体AI系统风险项数据集,验证了有效性。
事件专题

推荐理由:这个框架把AI用在职业培训全流程,5个阶段都提速,已经帮人通过NVIDIA认证考试,还有美国会计委员会背书,挺靠谱。
09:53
09:52
09:52官方账号arXiv cs.AI@Daniel Grillmeyer, Marius Hadry, Michael Stenger, Vanessa Borst, Veronika Lesch, Samuel Kounev
本文通过两项结构化文献综述,分别梳理了风力涡轮机功率曲线建模和光伏发电预测中的特征选择现状,发现现有方法有限且缺乏系统性。作者提出了一种名为CSFS(基于聚类的顺序特征选择)的模型无关包装器方法,并提供开源实现。实证中,CSFS与SFS、过滤式方法及随机森林特征重要性对比,在保持相近预测性能的同时,平均降低21%的计算成本。
推荐理由:这篇论文提出了CSFS方法,能在不牺牲预测精度的情况下减少21%的计算成本,适合做风电和太阳能预测的朋友参考。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。