#推理优化
这篇论文把PTQTP量化器约束成九级格式,在DeepSeek-V4上做到和官方API几乎一样准,还快6.7%、文件小9%,适合搞MoE推理优化的朋友看。
OpenAI 让自家模型 GPT-5.6 Sol 反过来优化自己的推理,成本降了20%,token 生成快了15%,挺有意思的。
OpenAI 搞了个新模型 GPT-5.6 Sol,能自己优化自己,部署后服务成本直接降了20%,生成速度还快了15%,搞推理服务的值得关注。
论文提出了DA-MoE,根据路由分布动态选最优内核,在DeepSeek-V3和Kimi K2上延迟最高降低56%,做MoE推理的同学可以关注这个优化思路。
NVIDIA把大模型冷启动快了4倍,DeepSeek-V4 Pro启动只要2分钟,靠ModelExpress和RDMA,推理和训练都能提速。
Robbyant 把 LingBot-VLA 2.0 的训练后代码开源了,单张 RTX 4090D 跑出 130 毫秒推理,不用集群就能自己玩。
这篇论文提出了一个聪明的点子:让注意力机制像人一样,在关键地方用更多计算资源,其他地方粗略处理。复杂度降低但精度不降,做推理优化的同学可以关注。
Together AI 把底层优化玩出花,ATLAS 加上 NVIDIA Blackwell 和一套 CUDA/TensorRT 工具,推理速度能快不少。搞部署的可以看看这套方案。
苹果想用这技术让27B的Qwen 3.6在手机上跑,速度比原来快8倍,能耗降75%,还能保持精度,挺牛的。
别盲目跑网格搜索了。这篇论文提出Floor-First方法,用资源向量估算性能下限,在DeepSeek-V3.2上验证了不同注意力布局的容量墙差异,帮你理性选部署方案。
LangChain让Nemotron 3 Ultra跑分0.86,成本只要4.48刀,比对手便宜近10倍,性价比拉满。
这篇论文告诉你如何从模型内部状态提前看出agent会失败,比看外部行为省算力多了,实测省三到四成。
想低成本跑DeepSeek?有第三方用SGLang和AMD MI300把API成本压到官方的五分之一,技术方案公开,值得参考。
这篇论文讲了个很实在的优化:让空闲的解码节点分担预填充活儿,不用等KV传输,TTFT降了81%
Qwen3.6-27B-NVFP4来了!在Blackwell上内存减半,MMLU Pro 86.3分,用vLLM就能跑,开源模型本地AI更省显存。
英伟达把 DeepSeek V4 的推理成本砍到五分之一,单 GPU 吞吐量暴增 20 倍,选 Blackwell 做推理的可以闭眼冲了。
SGLang 新功能无限 OCR 能一口气处理几十页文档,显存占用不变,比传统注意力省资源,适合长文档批量 OCR 场景。