09:52
09:52
官方账号arXiv cs.AI@Weishuai Zeng, Kangning Yin, Xiaojie Niu, Shunlin Lu, Weixiang Zhong, Jiahe Chen, Feiyu Jia, Xiao Chen, Zirui Wang, Furui Xu, Ming Zhou, Kailin Li, Weinan Zhang, He Wang, Li Yi, Dahua Lin, Jiangmiao Pang, Jingbo Wang 该论文提出行为基础模型(BFM)的缩放配方,核心包括运动跟踪学习范式、策略同步量与参考动作多样性的协同、以及可扩展的Humanoid Transformer架构。在仿真和真实世界部署中,Humanoid Transformer将局部模式下的平均关键点位置误差(MPKPE)降低10%以上,全局模式下降低82%。相比现有仿人控制器,该方法显著提升了控制保真度和任务泛化能力。论文验证了BFM作为通用仿人控制基础的有效性。
推荐理由:这篇论文把仿人机器人控制的缩放问题拆解清楚了:Humanoid Transformer配合特定训练范式,让MPKPE直接降了82%,比现有控制器强一大截。
09:38
09:38
官方账号arXiv cs.AI@Haoxuan Li, Tianci Gao, Jianhe Li, Yang Fan, Runze Shi, Weiran Wang, Tianxiang Zhao, Zezhao Wu, Xiaoyang Jiang, Qihui Zhang, Jia Li, Xiao Xiao, Kai Du, Xiaoxuan Jia, Chao Xie, Lu Mi BrainPilot 是一个完全开源的多智能体系统,旨在自动化脑科学发现过程。该系统包含一个统一脑科学知识库(7233个索引条目)和技能库(72个可复用方法单元),覆盖七个研究领域。每个步骤记录在Graph of Trace中,提供可审计的日志,同时Auditor agent负责检查编造内容。在Agents' Last Exam的三个脑科学任务及自建基准BrainPilotBench-v0上,BrainPilot使用开源骨干模型达到与SOTA框架相当的性能,且成本更低。
推荐理由:脑科学研究有多繁琐你懂的,BrainPilot开源出来帮你自动查文献、做分析、防编造,性能不输顶级框架还省钱。
09:22
09:22
官方账号arXiv cs.LG@Changhai Zhou, Kieran Liu, Yuhua Zhou, Qian Qiao, Jun Gao, Harry Zhang, Irvine Lu, Nolan Ho, Lucian Li, Andrew Lei, Cleon Cheng, Steven Chiang, Yihang Zeng, Di Zhang, Rio Yang, Kaijie Chen, Andrew Chen, Pony Ma, Weizhong Zhang, Cheng Jin LongStraw 是一种针对百万token级别强化学习后训练的架构感知执行栈,基于 GRPO 实现,在固定 GPU 预算下运行。它通过共享提示无自动求导评估、仅保留模型特定状态并逐次重放短响应分支,将实时训练图缩小以换取重放时间。在 8 块 H20 GPU 上,LongStraw 完成了 2.1M 位置的分组 Qwen 评分和响应反向传播;分组数从 2 增至 8 时,峰值显存仅增加 0.21 GB。在 32 块 H20 GPU 上,端到端执行路径验证了 GLM-5.2 全部 78 层的 2.1M token 提示处理能力。这些实验证明了执行容量,但完整训练正确性尚未全面验证。
推荐理由:LongStraw 能让你在固定 GPU 预算下做百万 token 级别的强化学习后训练,比现有 256K 的方法多处理 8 倍上下文,而且内存增长极低。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。