18:34Together AI@togethercomputeTogether AI 部署的 DeepSeek V4 Pro 在 Artificial Analysis 基准测试中同时获得输出速度和延迟两项第一。该成绩通过优化 KV 缓存、前缀复用、内核及端点配置实现。Together AI 公开了其推理系统的具体工程方案,包括缓存策略和内核调优。AI模型DeepSeek V4 ProTogether AIArtificial Analysis推理优化性能基准1 个信源在谈推荐理由:Together AI 把 DeepSeek V4 Pro 调到了速度与延迟双第一,还公开了优化方法,搞推理部署的值得看看。原文
13:11LMSYS Org (SGLang)@lmsysorg精选73°SGLang在NVIDIA GB300 NVL72平台上,针对DeepSeek V4 Pro 1.6T模型(FP4精度,8K/1K上下文)实现了每GPU超过12K tok/s的推理速度。该性能由NVIDIA Dynamo(SGLang)和MTP技术协同实现。根据SemiAnalysis InferenceX基准测试,该性能在整个交互性曲线上保持稳定。AI模型SGLangGB300 NVL72DeepSeek V4 ProNVIDIA Dynamo推理模型10 个信源在谈推荐理由:SGLang在GB300上跑DeepSeek V4 Pro,每GPU超1.2万token原文
02:21Cohere@cohere精选Cohere 发布 Command A+,在非拉丁语系语言测试中表现突出。在韩语、日语、希伯来语、中文和阿拉伯语上均超越 Mistral Medium 3.5。尤其在阿拉伯语上,Command A+ 比 Mistral Medium 3.5 高 5 个百分点,比 DeepSeek V4 Pro Sovereign AI 高 10 个百分点。AI模型Command A+Mistral Medium 3.5DeepSeek V4 ProCohere多语言模型1 个信源在谈推荐理由:非拉丁语表现更优原文