03:05阿里通义 Qwen@Alibaba_Qwen76°阿里 Qwen 团队联合多家合作伙伴,在 TokenSpeed 推理引擎上对 Qwen3.5 模型进行极致优化,实现了 580 tokens/秒的推理速度,创下智能体工作负载的新纪录。该成果得益于 NVIDIA GPU、FlashAttention-4 优化以及 PyTorch 社区的支持。这一里程碑展示了开源大模型在推理性能上的巨大潜力,尤其适合对延迟敏感的智能体应用场景。PyTorch 官方博客已发布完整技术细节。AI模型Qwen3.5推理优化TokenSpeed开源/仓库智能体推荐理由:580 tps 意味着智能体应用可以几乎实时响应,做 LLM 推理优化或 Agent 开发的团队值得关注这个开源方案,可以直接参考 PyTorch 博客里的实现细节。原文