10:00
10:00
官方一手arXiv: DeepSeek@Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu, Jian Meng, Zhengxuan Lu, Yiting Wang, Yucheng Xie, Tao Guo, Tianxiang Fang, Jing Li, Sihang Chen, Shihao Hong, Chang Liu, Weihua Dai, Zirong Zeng, Ziwei Zhu, Zhuohan Wang, Zhengjun Yue, Igor Vasilyev, Min Liu, Weijian Sun, Xin Chen, Yingmeng Gao, Jinhua Zhou, Taolue Chen, Chenwei Wu, Dong Zhang, Wenlong Jin, Jinmin Xiang, Barkova Maria, Ushakov Anton, Xianfei Jin, Tian Ding, Zhihang Lin, Qian Chen, Linxin Yang, Mingzhe Yang, Bingwei Zhang, Hongzhang Yang, Fangxue Zhang, Shijun Qin, Jie Yu, Cuihua Hu, Tolstykh Vasiliy, Nosov Ivan, Abdullin Amir, Zhichen Zhou, Xin Zhang, Zhixiong Ning, Xutong Zhao, Junjie Huang, Jiajun Liu, Weiyan Kong, Zheng Zhang, Wenhan Luo, Lin Hu, Yangbo Guo, Li Zeng, Shihao Zeng, Baotian Hu, Min Zhang, Haizhou Li, Zhiquan Luo 该论文针对万亿参数MoE模型DeepSeek-V4在Ascend NPU SuperPOD上的全参数后训练,提出分层优化框架,实现34.22%的模型算力利用率(MFU),较开源基线提升2.93倍。基于优化基础设施,论文构建了面向运筹学(OR)任务的连续预训练(CPT)和微调(SFT)工作流。SFT数据集包含10K高质量样本,涵盖4个任务类别和3种问题表示。专用模型DeepSeek-V4-Flash-OR在零样本Pass@1上达到71.81%,比GPT-5.4-Mini高3.98个百分点,比基础DeepSeek-V4-Flash高11.27个百分点。
推荐理由:这篇论文展示了如何在华为Ascend芯片上高效后训练万亿参数模型,并且通过运筹学专用微调,在特定任务上超越了GPT-5.4-Mini。
12:57
12:57
官方账号arXiv cs.AI@Qijia He, Jiayi Cheng, Chenqian Le, Rui Wang, Xunmei Liu, Yixian Chen, Jie Mei, Zhihao Wang, Xupeng Chen, Yuhuan Chen, Tao Wang 该论文提出CodeRescue框架,用于编程智能体失败后的恢复路由决策。通过监督路由器从执行轨迹中学习,选择廉价恢复或升级到更强模型。添加Conformal Risk Control(CRC)层,无需重新训练即可适应不同预算,提供边际期望成本控制。在五个编程基准的失败案例上,校准前沿优于固定动作、仅提示路由器和二元级联基线。在GPT-5.4-nano/GPT-5.4设置下,一个CRC校准前沿点比始终升级的解决率更高,且平均恢复成本仅为其35%。
推荐理由:编程智能体失败后,是再用便宜模型试试还是直接上贵的?这篇论文搞了个路由器和校准方法,在GPT-5.4-nano上省了65%的钱还保证解决率不降。
12:05
12:05
官方账号arXiv cs.LG@Lance Kennedy, Hossein Amiri, Yueyang Liu, Riyang Bao, Hanqi Chen, Mohammad Hashemi, Ruochen Kong, Xiaotong Liu, Joon-Seok Kim, Shengpu Tang, Liang Zhao, Andreas Züfle 该论文引入了16个大规模模拟数据集,每个数据集包含数千个智能体的轨迹及带注释的驻留点,并涵盖不同的轨迹噪声水平。作者评估了9种驻留点检测算法,包括现有最优方法和新提出的方法。结果显示,现有算法在真实噪声条件下表现较差,而提出的无监督方法有显著改进,监督方法则大幅超越现有基线。该论文指出,这些数据集和方法仅作为未来研究的起点。
推荐理由:这篇论文提供了16个带噪声的轨迹数据集和9种驻留点检测算法评估,发现现有方法在真实噪声下效果差,而他们的新方法提升明显,对做轨迹分析的人很有参考价值。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。