Qwen3-1 是一种基于强化学习的推理语言模型,近期研究聚焦于其在离线训练与在线部署中的鲁棒性挑战,尤其是奖励黑客、灾难性遗忘以及推理能力泛化等问题。
№qwen31·general
Qwen3-1
别名
- 首次出现
- 2026-05-22
- 最近出现
- 2026-07-15
- 累计提及
- 20
§ 01综述
§ 02相关报道09 条在档
- 01JADR协议:通过J-Space比较不同模型与量化级别的危险识别
- 02AdaPrefix-GRPO:自适应前缀控制提升困难推理问题训练效果
- 03弱到强泛化通过Direct On-Policy Distillation
- 04悲观悖论:保守离线训练放大推理模型在线适应中的奖励黑客
- 05MAST:机制引导的选择性遗忘方法,降低RLVR推理遗忘的附带损害
- 06RA-RFT:通过检索增强强化微调实现类比推理
- 07Skill-Conditioned Gated Self-Distillation 提升 LLM 推理能力
- 08Hugging Face 开源 CLI 智能体,自动完成 ML 工程师研究全流程
- 09稀疏到稠密奖励原则:语言模型后训练新范式
§ 03邻近话题