做配音或语音应用的可以看下这个 TTS 排行榜,HeyGen 转发的 Artificial Analysis 榜单,各家模型水平一目了然。
#Artificial Analysis
OpenAI 给受信访问的 GPT-6 Sol(Daybreak Blue)几乎没有网络安全防护,跑分直接登顶还比 Grok 4.7 便宜好几倍,值得看看细节。
Artificial Analysis 的模型榜单要更新了,v5 加入 Terminal-Bench Science 和私有数据集的编程测试,看榜单选模型的朋友可以蹲一下。
Theo 拆解了那个流传很广的年烧 1.3 亿美元 Token 的说法,数据讲得挺细,做 AI 产品算成本前建议看看。
生数科技的 Vidu Q4 Preview 一上线就冲到 Artificial Analysis 视频榜第 3,能出 4K 带音频的视频,价格还和上一代一样,可以试试。
同一条提示词让各家模型写交互式黑洞,Artificial Analysis 把结果放一起对比,想选编程模型的可以看看谁的效果最像 Gargantua。
Reflection 新模型 Beam 正在被 Artificial Analysis 独立测试,早期数据显示它是同级开源模型里最省 token 的之一。
一家影视工作室自己训的视频模型,基于 MiniMax H3,一上榜就冲到带音频文生视频第二,导演直接参与训练反馈,思路挺特别。
Artificial Analysis 新增了安全拒绝报告,能看模型什么时候拒绝、切换到哪个备用模型,Claude Sonnet 拒绝率只有 Opus 的一半。
Artificial Analysis在首尔办了场AI聚会,有美国专家讲任务成本,SK电信和TrillionLabs展示了他们的AI模型进展。
网络安全方向的新基准,Grok 4.7 和 MiMo-V2.6-Pro 并列第一,但 GPT-6 Sol 在端到端任务上全部拒绝执行,这个对比挺有意思。
Artificial Analysis 发文回顾两年:o1-preview 开创推理模型,他们的评测指数也从 4 项考试题扩到 10 项智能体任务,能看清评测怎么进化。
阿里 Qwen3.8-Max 被曝跑了 33 轮自动训练迭代,AA 分数从 40 涨到 45,还有 2.4T 参数的说法。
给 Agent 做实时联网搜索可以看看 Octen,0.21 秒一次查询,价格只有 Exa auto 的七分之一,三项基准都进前三。
想了解 iPhone 17 Pro 上 AI 模型的性能表现?看这篇,详细分析了 8GB 以内模型的跑分情况。
Artificial Analysis刚发了搜索API基准,用GPT-5.6 Luna测了7家提供商,帮你选搜索工具时看质量、成本、速度。
DeepSeek 悄悄改了 V4 Pro 版本号,但更新日志和公告都没跟上,连跑分也只比 V4 Flash 高 1 分,想确认是不是撤了模型的可以看看这个讨论。
阿里千问新语音模型能通过标签控制语气情绪,支持16种语言和20种方言,48KHz音质,试试让语音笑或生气。
GLM 5.2 在 Together AI 上跑出了最快速度和最低延迟,想用低成本跑推理的话可以去试试这个组合。
Together AI 把 DeepSeek V4 Pro 调到了速度与延迟双第一,还公开了优化方法,搞推理部署的值得看看。
GLM5.2在开源模型排名拿了第一,而且有人说用起来感觉像Opus 4.6,你要是想换掉Deepseek V4 Pro可以试试。
StepAudio 2.5 TTS 在公开盲测中击败国际竞品,证明国产TTS模型已具备全球竞争力,对AI语音应用开发者具有参考价值。