AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
全部 AI 动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
标签:推理速度×
6月25日
02:24
02:24Clement Delangue@ClementDelangue
精选
Kog在HuggingFace上开源了其2B参数模型,该模型此前被用于演示,运行速度达到3000+ tokens每秒。开源模型可供开发者下载和部署,适用于快速推理场景。
AI模型KogHuggingFace2B模型开源模型推理速度

推荐理由:Kog开源了一个2B模型,每秒能处理3000多个token,适合需要高速推理的任务。
原文
6月16日
20:46
AITOP6月16日 20:46
600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI
6月12日
12:57
AITOP6月12日 12:57
Claude代码里藏了个20260612,18个月后的AI记忆革命已经开始倒计时
6月11日
15:28
AITOP6月11日 15:28
1107 vs 303:谷歌悄悄开源了一个“拆打字机”的模型,把大模型速度翻了4倍
15:23
AITOP6月11日 15:23
DiffusionGemma颠覆文本生成?自回归模型的“统治”要结束了
15:07
AITOP6月11日 15:07
每秒1107个token,Google开源的扩散模型为什么能改变本地推理格局?
6月9日
20:09
20:09Viking@vikingmute
小米发布了 MiMo-V2.5-Pro-UltraSpeed 模型,拥有 1T 参数,生成速度达到 1000 TPS。官方演示视频显示速度极快,引发关注。目前该模型开放试用申请,但用户对其实际质量存疑,因为小米此前在 AI 模型领域知名度不高。该模型在 HackerNews 上引起讨论,速度指标令人印象深刻,但最终效果仍需实测验证。
AI模型小米MiMo大模型推理速度TPS

推荐理由:1T 参数模型跑出 1000 TPS 的生成速度,对追求低延迟推理的开发者来说是个值得关注的指标,建议申请试用实测质量。
原文
5月30日
06:42
06:42rohanpaul_ai@rohanpaul_ai
88°
Anthropic 在宣布 9650 亿美元估值融资的同一天,发布了 Claude Opus 4.8 模型。KogAI 在 8× AMD MI300X GPU 上实现了 3000 tokens/s 的推理速度,在 8× NVIDIA H200 上达到 2100 tokens/s。Datacurve 推出了更严格的编程基准 DeepSWE,用于区分领先模型。OpenAI 与 Thrive 合作构建了准确率高达 97% 的自我改进税务智能体。
AI产品AnthropicClaude Opus 4.8推理速度编程基准税务智能体

推荐理由:Anthropic 估值逼近万亿,Claude Opus 4.8 同日发布,关注前沿模型进展的开发者值得一看。KogAI 的推理速度数据对做推理优化的团队有参考价值。
原文
5月23日
05:51
05:51rohanpaul_ai@rohanpaul_ai
Cerebras 宣布其晶圆级芯片在 1 万亿参数的 Kimi K2.6 模型上达到了 981 tokens/sec 的推理速度,经 Artificial Analysis 验证,比最快的 GPU 云快 6.7 倍。传统 GPU 集群因跨芯片拆分模型导致大量数据传递延迟,而 Cerebras 的晶圆级芯片将整个处理器构建在单个硅晶圆上,片上路由带宽更高、延迟更低。这一速度优势对于企业级编程智能体等需要快速迭代测试和调试的场景尤为关键。Cerebras 声称其真正的商业价值不在于单纯的速度,而在于能在足够大的模型上实现这种速度,从而支撑企业级应用。
AI产品CerebrasKimi K2.6推理速度晶圆级芯片企业级智能体

推荐理由:做企业级 AI 推理或编程智能体的团队,如果被 GPU 集群的延迟和带宽瓶颈困扰,Cerebras 的晶圆级方案值得关注——它用硬件架构创新解决了模型权重和激活值传输的痛点,实测数据比 GPU 云快一个数量级。
原文
5月20日
07:10
07:10Clement Delangue@ClementDelangue
精选
Cerebras 正在企业测试中运行 Kimi K2.6,这是一个万亿参数模型。据 Artificial Analysis 测量,其推理速度约为每秒1000个 token,是迄今最快的前沿模型性能。这反驳了此前认为开源大模型无法快速运行的质疑。
AI模型CerebrasKimi K2.6推理速度开源模型

推荐理由:Cerebras 让万亿参数模型跑出千 token 每秒
原文
5月16日
14:56
14:56Ate-a-Pi@svpino
开发者 Santiago 表示首次感到开源权重模型不可忽视,MiniMax-M2.7 以 230B 参数在 SambaNova 上实现 440+ tokens/s 的极速推理。该模型在 SWE-Pro 上得分 56.22%,Terminal Bench 2 得分 57.0%,SWE Multilingual 得分 76.5%,性能接近 Opus 4.6 和 GPT-5.4 级别。使用成本仅为专有模型的 5%,且完全开源。SambaNova 提供免费 playground 供测试。
AI模型开源模型MiniMax-M2.7推理速度SambaNova性能对比

推荐理由:开源模型首次在性能上追平顶级闭源模型,且推理速度和成本优势巨大,做 AI 应用开发或模型选型的团队值得立即体验。
原文
精选全部日报登录