Together ATLAS 联合 NVIDIA Blackwell 等实现推理延迟优化
Together AI 把底层优化玩出花,ATLAS 加上 NVIDIA Blackwell 和一套 CUDA/TensorRT 工具,推理速度能快不少。搞部署的可以看看这套方案。
Together AI 把底层优化玩出花,ATLAS 加上 NVIDIA Blackwell 和一套 CUDA/TensorRT 工具,推理速度能快不少。搞部署的可以看看这套方案。
Qwen3.6-27B-NVFP4来了!在Blackwell上内存减半,MMLU Pro 86.3分,用vLLM就能跑,开源模型本地AI更省显存。
AWS发了篇实战教程,教你用NVIDIA Blackwell在SageMaker上调优训练,从选精度到调batch size都讲清了,搞大模型训练的人别错过。
UC San Diego搞了个新方法DFlash,用扩散模型直接生成整段token,比自回归快几倍,Qwen3-8B上6倍加速,Blackwell上15倍,还开源了检查点,搞推理加速的可以看看。
Cohere 与 NVIDIA 的深度合作让 Command A+ 在 Blackwell 上跑出最佳性能,做企业级 AI 部署的团队值得关注这个新选择。