一篇 MoE 训练论文:把固定 top-k 换成在 k 附近随机采样,Qwen3-30B-A3B 微调能多拿 2 分,推理成本不变。
#Qwen3
共 89 条 · 7 天 4 条 · 30 天 23 条 · 话题观测 →
信息流里打上「Qwen3」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
Elastic Expert Routing:软化 MoE top-k 路由边界,提升 OLMoE 与 Qwen3 微调效果
10月6日
10月5日
10月4日
Build A Reasoning Model 第 6 讲:用纯 PyTorch 从零实现 GRPO 训练推理模型
Raschka 又更新了,这讲直接用 PyTorch 手写 GRPO,把 Qwen3-0.6B 的数学成绩从 15% 拉到 47%,想搞懂推理模型怎么训的别错过。
10月2日
10月1日
9月30日
9月29日
PEARL:面向智能体强化学习的自适应 Prefill-Decode 弹性执行系统
训练智能体 RL 的人可以看看:PEARL 动态调 prefill-decode 配置还能借闲置 GPU,吞吐比 RLBoost+ 最高多 36.3%。
9月28日
9月26日
9月25日
RL-Kernel 集成 vLLM:Qwen3-8B 训练与推理 logprob 逐位一致
用 vLLM 做 RL 训练的老大难——训练和推理数值对不上,这次在 AMD MI300X 上真做到了逐位一致,做 RL 的都该看看。
9月24日
UECR-GRPO:用熵校准统一策略内蒸馏与GRPO的信用分配
教小模型做数学题的新训练方法,把教师模型的逐token提示和答案对错验证揉进一个GRPO更新里,Qwen3-1.7B和4B都涨了不到1个点,做RL训练的可以看看细节。
9月22日
9月21日
Cognition 团队开源 Jev-like 决策模型 Kev,基于 Qwen3 底座
朋友,Cognition 团队开源了一个叫 Kev 的小型决策模型,基于 Qwen3,你可以自己训练和本地部署,对消费级硬件很友好。
9月9日
9月4日
9月3日
9月2日
9月1日
8月31日
8月24日
8月20日
8月15日
8月14日
VUI Labs语音模型Luna-TTS登顶TTS Arena,击败ElevenLabs
VUI Labs的Luna-TTS登顶语音评测榜,延迟才41.6毫秒,比ElevenLabs还快,搞语音合成的该看看。
MiniMax发布音乐模型MiniMax-Music3,最长可生成5分钟歌曲
MiniMax发布了Music3音乐模型,给歌词和描述就能生成5分钟完整歌曲,前奏副歌桥段都有,比常见几十秒的音乐生成更完整。
IT之家原文
8月11日
TIDE:解决LLM在线蒸馏中师生不匹配问题
这篇论文讲了个反直觉的事:蒸馏时师生token一致反而可能有害。TIDE方法在数学推理上把准确率从6.9%拉到20.3%,还让回答短了3.6倍,值得做LLM后训练的人看看。
8月10日
8月7日
8月6日
论文11:34
Skill Entropy:长程推理的技能切换评测与训练Skill Entropy能测出模型切换推理技能的短板,还能当训练信号:Qwen3小模型得分从34%飙到68%,也能用在OpenR1-Math数据上。