#Qwen3
共 89 条 · 7 天 4 条 · 30 天 23 条 · 话题观测 →
6月3日
6月2日
Qwen3 2-bit 推理失败模式与恢复:FP16 规划+循环救援提分至 87.2%
做推理模型量化和部署的团队终于有了针对 2-bit 失败模式的系统解法——不是简单降精度,而是用 FP16 规划和循环救援来修复生成过程,Qwen3 用户可以直接复现并提升准确率。
5月28日
5月27日
用 ZeroEntropy Zerank-2 重排序器构建高精度检索管道
做 RAG 或搜索系统的开发者,这个教程直接教你用 Zerank-2 搭建两阶段管道,从环境配置到实战代码都有,值得跟着跑一遍。
5月25日
MoE模型浪费一半专家计算?ZEDA框架让Qwen3等模型跳过简单token
部署MoE模型的团队终于可以省下一半专家计算——ZEDA让Qwen3和GLM等模型自动跳过简单token,推理速度提升20%且几乎不掉精度,做模型推理优化的开发者可以直接参考论文方法。
5月19日
EnvFactory:自动合成可执行环境与鲁棒RL,提升工具使用Agent性能
做Agentic RL的团队终于有了自动化环境构建方案——EnvFactory只用85个环境就碾压了此前5倍数据量的方法,想省掉手动造环境成本的开发者可以直接用。
5月13日
Perplexity 发布 Qwen3 235B 在 NVIDIA GB200 上的推理研究
做大规模模型推理部署的团队值得关注——GB200 在 MoE 模型上的推理效率提升显著,Perplexity 的实践给出了可直接参考的优化路径。
5月11日