#模型优化
作者分享了自己探索 141 个技能的经验,发现 Waza 这 4 个技能效率最高,并给出具体优化方法,比如合并冗余内容、按规则精简功能,对想提升模型使用效率的人很有参考价值。
这篇论文提供了Transformer注意力中LoRA秩选择的深入理论分析,对于理解LoRA在Transformer模型中的应用非常有帮助,特别是对于想要优化模型性能的工程师来说。
DualOPSD在模型规模和性能上都有显著提升,是自蒸馏领域的一个新突破。与OPSD相比,DualOPSD在多个基准测试中取得了更好的成绩,值得关注。
这篇论文提出了一种在手机上跑大模型的新思路:不加载全部神经元,只算有用的部分。效果不错,内存和计算都省很多,关键是精度没掉。
Suhail 亲自招人做模型底层优化,玩 vLLM 和 sglang 的可以看看,机会难得。
做智能体部署和运维的团队终于有了专门的监控与学习工具,BentoLabsAI 能直接提升模型效果,值得关注和试用。
小米公开的推理系统优化方案直接解释了 MiMo-V2.5 降价 99% 的技术基础,做模型推理部署的团队可以借鉴其 Hybrid SWA 和缓存管理思路,看完会明白长序列推理成本如何真正降下来。
写Prompt总感觉模型不听话?FaceMind的实验戳破了“高级词汇”的幻觉——用高频表达能让模型表现直接起飞,做Prompt工程或微调模型的开发者值得一试。
部署MoE模型的团队终于可以省下一半专家计算——ZEDA让Qwen3和GLM等模型自动跳过简单token,推理速度提升20%且几乎不掉精度,做模型推理优化的开发者可以直接参考论文方法。
Cohere 与 NVIDIA 的深度合作让 Command A+ 在 Blackwell 上跑出最佳性能,做企业级 AI 部署的团队值得关注这个新选择。
Apple 这篇研究把 On-Policy Distillation 的坑和甜点都讲透了,做模型压缩或部署的团队可以直接参考,避免踩坑。