Qwen3-30B-A3B
general · 首次出现 2026-05-22 · 最近出现 2026-09-09 · 累计提及 21
综述
相关报道
10 条在档- OSOL缓解多领域强化学习中的高阶干扰arXiv cs.LG
- MoE模型中三种推理优化为何失效arXiv: DeepSeek
- 本地运行AI模型的内存知识:独立显卡与统一内存的权衡阮一峰的网络日志
- TRACE:通过信用估计实现长程智能体回合级奖励分配arXiv cs.LG
- 用大语言模型学习化学反应机理推理,Qwen3微调模型超越专用FlowERarXiv cs.LG
- SARA:通过语义锚定路由对齐解锁MoE多语言知识arXiv cs.AI
- 结构剪枝新方法:基于归因引导和覆盖最大化的MoE压缩arXiv: DeepSeek
- ConMoE:无需微调的MoE压缩框架,通过原型重分配保留专家池arXiv: DeepSeek
- MoE转稠密模型:首个系统框架将混合专家模型蒸馏为全稠密架构arXiv: DeepSeek
- MoE模型浪费一半专家计算?ZEDA框架让Qwen3等模型跳过简单tokenrohanpaul_ai