VOL.2026.08.29·271 STORIES·AITOP DAILY

AITOP日报

二〇二六年八月二十九日 星期六DAILY · 每早八时
01

模型发布/更新

Model Releases
5

Poor Lab发布Puro-2B模型,训练成本低于5090美元

官方账号X·KOLX:arXiv cs.LG (@Kairong Luo, Jiarui Cui, Yaorui Yin, Shengqi Chen, Yiming Yang, Linxiang Gao, Yanmohan Wang, Mingzhe Zhang, Kaiyue Wen, Kaifeng Lyu, Wenguang Chen)原文 ↗

Poor Lab团队使用RTX 5090显卡训练了Puro-2B模型,总计算成本低于6900美元。该模型在1.4万亿token数据集上以FP8精度进行训练,性能接近Qwen2.5-1.5B。团队还提出了Puro成本缩放定律,显示约4420美元即可达到Qwen2-1.5B性能。完整训练食谱已在Apache 2.0许可下开源。

WikiSkill:将智能体经验转化为持久知识

官方账号X·KOLX:arXiv cs.AI (@Liyan Tang, Cyrus Rashtchian, Chun-Sung Ferng, Andrew Tomkins, Da-Cheng Juan, Tu Vu)原文 ↗

WikiSkill框架通过将执行经验、积累知识和可执行技能分离,持续将经验整合到知识库中。该框架在多个基准测试和模型上表现优于最先进的技能进化方法,在大多数模型-基准设置中优于无技能基线。研究发现技能进化与模型扩展互补:大模型通常从进化技能中获益更多,而有技能的小模型可以显著超越无技能的大模型。技能在不同模型和模型家族间能有效转移,其他模型进化的技能甚至可以超越自我进化的技能。

KinyaEmbed:基尼亚万达语对比句嵌入模型

官方一手X·KOLX:arXiv: OpenAI (@Ireddi Rakshitha, Devavarapu Yashwanth, Ntakirutimana Pierre)原文 ↗

KinyaEmbed是首个专为基尼亚万达语设计的句子嵌入模型,该语言在卢旺达有1200万使用者。模型基于KinyaBERT-large,通过四阶段课程训练:第一阶段使用约18,000对同义句,第二阶段在715个NLLB翻译的三元组上微调,第三阶段使用英-基尼亚万达语翻译对对齐表示,第四阶段用2,936对高质量数据 refine。在SemRel2024-rw基准上,七检查点集成模型得分达0.7298,超越mE5-large 20.9%和OpenAI text-embedding-3-large 41.0%。

02

产品发布/更新

Product
5
03

行业动态

Industry
5
04

论文研究

Research
5

MetaNet:任务条件专家动态分配

官方一手X·KOLX:arXiv: DeepSeek (@Rongfeng Wang, Shichao Weng, Zhiqiang Wang, Xinyu Liu, Yang Yi, Peilong Zhou, Hongwei Tang)原文 ↗

MetaNet提出了一种支持集控制器,可为每层预测专家保留阈值和有界路由偏差。在DeepSeek-MoE-16B-Chat模型上,保守设置激活专家数减少40%,MMLU准确率0.489;激进设置激活专家减少62%,准确率下降3.7个百分点。MMLU训练的控制器无需重训即可迁移到C-Eval,激活专家减少52%,准确率达0.386。

MoE模型中三种推理优化为何失效

官方一手X·KOLX:arXiv: DeepSeek (@Gokulakannan Sakthivel, Jerry Wu, Amogh Rajendra, Giriprasad Radhakrishnan)原文 ↗

研究测量了OLMoE-1B-7B、DeepSeek-V2-Lite和Qwen3-30B-A3B三种MoE模型上的三种推理优化效果。Fused Triton内核在隔离测试中达到5.6x至9.0x加速,但端到端实际效果仅为0.999x,远低于1.07x的理论上限。INT4量化平均每位置仅改变8个专家中的0.53个,且通过全精度权重重放这些改变路线仅造成2.7%的质量损失。

并行分布式推理语言模型性能基础

官方一手X·KOLX:arXiv: DeepSeek (@Maciej Besta, Leonard Schmidt, Lara Nonino, Robert Gerstenberger, Pierre Pang, Patrik Okanovic, Ales Kubicek, Tiancheng Chen, Baraq Lipshitz, Torsten Hoefler)原文 ↗

本文系统化分析了RL-for-LLM范式,对PPO、GRPO等主流后训练算法框架进行了计算中心分析。作者提出了推理语言模型(RLMs)的并行策略分类法,涵盖数据、张量、流水线等传统技术以及解耦放置、阶段融合等新型并行技术。研究还分析了现有RLM框架,并构建了可扩展、快速且经济高效的RLM实践指南。

VPP:提升长上下文LLM推理效率的虚拟流水线并行

官方一手X·KOLX:arXiv: DeepSeek (@Yan Shi, Xiaochao Wang, Jingchun Gao, Jintao Luo, Xinyi Zhou, Feng Liu, Kui Luo, Xushi Li, Xinjie Guo, Liangjun Feng)原文 ↗

VPP是一种新的虚拟流水线并行技术,用于优化长上下文LLM推理中的分块预填充。该方法保持块大小固定,通过虚拟流水线布局减少流水线气泡。在vLLM-Ascend中实现后,VPP在16块Ascend 910C NPU上测试了三种MoE模型,序列长度达100万token。相比DCPP,VPP在长序列上吞吐量提升13.1%,在混合工作负载上提升6.7%,在512K token的DeepSeek-V3.1预填充任务中,流水线气泡比例从6.4%降至0.1%。

05

技巧与观点

Tips & Takes
5
271
今日事件
56
一手报道
41
新模型
75
信源
AITOP · 编辑系统自动生成