#MoE
共 251 条 · 7 天 14 条 · 30 天 59 条
5月15日
5月14日
MinT:管理百万级LoRA策略的训练与推理基础设施
做大规模LoRA训练和推理的团队终于有了正经的工程方案——MinT解决了策略数量爆炸时的资源浪费问题,用适配器分离和调度大幅降低成本,搞大模型服务的建议点开看看。
5月13日
DeepSeek 开源 DeepEP:首个面向 MoE 模型的专家并行通信库
MoE 模型的通信瓶颈是训练和推理的常见痛点,DeepEP 直接解决了这个问题。做大规模 MoE 训练或推理的团队,值得集成试试。
ROMER:模拟存算一体系统上MoE大模型的鲁棒性校准框架
模拟存算一体是突破大模型内存墙的关键路线,但硬件噪声对MoE架构的破坏一直未被正视。做硬件-算法协同设计的团队,这篇论文给出了可直接复用的校准方案,值得细读。
Perplexity 发布 Qwen3 235B 在 NVIDIA GB200 上的推理研究
做大规模模型推理部署的团队值得关注——GB200 在 MoE 模型上的推理效率提升显著,Perplexity 的实践给出了可直接参考的优化路径。
5月11日
论文19:03
EngGPT2-16B-A3B基准:意大利语MoE模型表现优于同类该评测展示了意大利本土LLM的最新进展,对关注多语言模型(尤其是意大利语)的研究者和开发者具有参考价值,也反映了MoE架构在中等参数规模下的实际性能水平。
arXiv: DeepSeek原文