#推理速度
共 14 条 · 7 天 1 条 · 30 天 2 条
信息流里打上「推理速度」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
9月30日
8月14日
7月22日
7月10日
OpenAI产品策略调整:模型每6周交付一次,GPT 5.6在Cerebras上达750 tokens/s
OpenAI调整了模型发布节奏,以后每6周就能看到新版本。GPT 5.6在Cerebras上跑出750 tokens/s的推理速度,10秒就能处理一大波PR。2026年的重点从刷速度变成了追求实际价值。
7月7日
Bleys 估计 GPT-5.6 Sol 参数达 2-4 万亿,推理速度 750 tokens/s
Bleys 算了一笔账:GPT-5.6 Sol 参数 2-4 万亿、跑在 Cerebras 晶圆上、速度 750 token/s,但价格可能翻倍。想了解下一代超大规模模型怎么造?看这个。
6月25日
6月9日
模型20:09
小米 MiMo-V2.5-Pro-UltraSpeed 1T 参数模型生成速度达 1000 TPS1T 参数模型跑出 1000 TPS 的生成速度,对追求低延迟推理的开发者来说是个值得关注的指标,建议申请试用实测质量。
小米 MiMo V2.5-Pro-UltraSpeed 突破万亿参数模型千 tokens/s 输出
万亿参数模型首次达到千 tokens/s 输出,做大规模推理或实时 AI 应用的团队可以直接申请体验,看看能否真正落地到生产环境。
IT之家原文
5月30日
Anthropic 发布 Claude Opus 4.8,估值达 9650 亿美元
Anthropic 估值逼近万亿,Claude Opus 4.8 同日发布,关注前沿模型进展的开发者值得一看。KogAI 的推理速度数据对做推理优化的团队有参考价值。
5月23日
Cerebras 在 1T 参数 Kimi K2.6 模型上实现 981 tokens/sec,比 GPU 云快 6.7 倍
做企业级 AI 推理或编程智能体的团队,如果被 GPU 集群的延迟和带宽瓶颈困扰,Cerebras 的晶圆级方案值得关注——它用硬件架构创新解决了模型权重和激活值传输的痛点,实测数据比 GPU 云快一个数量级。
5月22日
智谱AI推出GLM-5.1高速API:400 tokens/s创全球新纪录
400 tokens/s的推理速度让实时AI应用成为可能,做聊天机器人或代码补全的开发者可以直接接入体验,响应延迟会明显降低。
5月20日
5月16日
MiniMax-M2.7 开源模型性能媲美 GPT-5,推理速度 440+ tokens/s
开源模型首次在性能上追平顶级闭源模型,且推理速度和成本优势巨大,做 AI 应用开发或模型选型的团队值得立即体验。