02:26Mustafa Suleyman@mustafasuleyman精选微软推出的MAI-Image-2.5-Pro成为Artificial Analysis图像编辑榜单第一名,超越了Reve 2.1、GPT Image 2等模型,同时在文本转图像领域位列第七;该模型于7月23日在Microsoft Foundry预览发布,主打高质量图像处理功能。AI模型MAI-Image-2.5-ProArtificial Analysis图像编辑4 个信源在谈事件专题推荐理由:微软发布了MAI-Image-2.5-Pro,做高质量图像编辑很厉害,比Reve 2.1这些模型表现更好,适合专业图像任务使用。原文稍后读已读值得跟进有用关注 MAI-Image-2.5-Pro
02:56官方账号Decoder@Matthias BastianArtificial Analysis 发布了名为 Search Index 的基准测试,用于评估 AI 智能体搜索 API 的质量、成本和速度。该测试涵盖了 7 家搜索 API 提供商。在使用 GPT-5.6 Luna 进行的测试中,Parallel、Exa 和 Firecrawl 获得了最高评分。论文Artificial AnalysisSearch IndexParallel推荐理由:选搜索 API 有参考了,Search Index 测了 7 家,Parallel 和 Exa 排名靠前。原文稍后读已读值得跟进有用关注 Artificial Analysis
01:52elvis@omarsar078°Artificial Analysis发布Search Index,对比7家搜索API提供商在AI智能体中的表现。基准包含DeepSearchQA(900个问题)、BrowseComp(200个样本)和AA-Omniscience(600个问题),共1700个问题。测试使用GPT-5.6 Luna (medium)模型,在Stirrup开源智能体框架中运行。初始覆盖11个结果,后续将扩展覆盖范围。AI模型Artificial AnalysisGPT-5.6 LunaStirrup推荐理由:Artificial Analysis刚发了搜索API基准,用GPT-5.6 Luna测了7家提供商,帮你选搜索工具时看质量、成本、速度。原文稍后读已读值得跟进有用关注 Artificial Analysis
15:30官方账号阿里通义 Qwen@Alibaba_Qwen精选73°Qwen3.8-27B在Artificial Analysis Intelligence Index上达到DeepSeek V4-Pro和GPT 5.6 Luna的性能水平,成为首个获得前沿模型能力的本地模型。该模型仅27B参数,却实现了与大型前沿模型相当的表现。Qwen团队表示,这一进展速度超出预期,未来将应用于更多领域。AI模型Qwen3.8-27BDeepSeek V4-ProGPT 5.6 Luna4 个信源在谈事件专题推荐理由:Qwen的27B本地模型跑出了DeepSeek V4-Pro和GPT 5.6 Luna的水平,本地模型也能打前沿了,值得看看。原文稍后读已读值得跟进有用关注 Qwen3.8-27B
14:14官方账号Decoder@Tomislav BezmalinovićArtificial Analysis发布Optima平台,允许用户用自有数据和工作流构建自定义AI基准。该平台可按质量、单项任务成本和耗时对比模型。对于智能体应用,这些指标比原始token定价更能反映实际表现。AI产品OptimaArtificial Analysis基准测试推荐理由:想让AI模型按你的数据跑分?Optima能自定义基准,比通用榜单靠谱。原文稍后读已读值得跟进有用关注 Optima
18:11官方一手歸藏(guizang.ai)@op7418精选DeepSeek V4 Pro 的 0831 版本在 API 模型列表中显示为 0813,但更新日志页面没有任何对应记录。官网原本标注“DeepSeek V4 Pro 更新正式版”的横幅已被撤下。模型文档与更新日志版本不一致,且官方没有发布公众号文章或公告。Artificial Analysis 的测试中,V4 Pro 正式版仅比 V4 Flash 高 1 分,几乎持平。作者认为这让熬夜等待测试的用户感到困惑和被戏弄。AI模型DeepSeekV4 ProV4 Flash推荐理由:DeepSeek 悄悄改了 V4 Pro 版本号,但更新日志和公告都没跟上,连跑分也只比 V4 Flash 高 1 分,想确认是不是撤了模型的可以看看这个讨论。原文稍后读已读值得跟进有用关注 DeepSeek
21:51官方账号Decoder@Maximilian Schreiner阿里发布的Qwen3.8 Max在Artificial Analysis Intelligence Index上得分56,比上一代Qwen3.7 Max的46分高出10分。该分数追平了Claude Opus 4.8。但Kimi K3的得分更高,且成本低25%。AI模型Qwen3.8 MaxClaude Opus 4.8Kimi K310 个信源在谈事件专题推荐理由:Qwen3.8 Max一口气涨10分追平Claude,但Kimi K3更便宜还更强,值得看。原文稍后读已读值得跟进有用关注 Qwen3.8 Max
18:14量子位@量子位的朋友们阿里Qwen3.8在Artificial Analysis的Agentic能力榜单中得分全球第一,超越其他参评模型。该榜单重点考察模型在智能体任务中的工具调用与多步推理表现。这标志着Qwen3.8在复杂任务自主执行方面已达到全球领先水平。AI模型Qwen3.8Artificial Analysis阿里推荐理由:阿里的Qwen3.8在Artificial Analysis的智能体能力榜上拿了第一,做Agent开发选它准没错。原文稍后读已读值得跟进有用关注 Qwen3.8
12:29Hailuo AI@Hailuo_AIMiniMax H3 在 Artificial Analysis 视频编辑排行榜位列第一,文本转视频排名第二,图像转视频排名第三。该模型支持输入文本、图像、视频和音频,生成 5-15 秒 24fps 带原生音频的片段,2K 视频定价为每秒 0.13 美元(每分钟 7.80 美元)。其价格低于 Dreamina Seedance 2.0 的每分钟 22.45 美元、HappyHorse-1.1 的 9.90 美元和 Kling 3.0 的 20.16 美元,但高于 Google Gemini Omni Flash 的 6.00 美元。MiniMax 计划以社区许可发布权重,营收低于 2000 万美元的组织可商用,需显著署名。当前该模型已在 Hailuo AI app 和 MiniMax API 提供。AI模型MiniMax H3HailuoArtificial Analysis5 个信源在谈事件专题推荐理由:视频编辑直接登顶的 MiniMax H3,带原生音频,价格不到 Kling 的一半,还说要开源权重,做视频的可以试试。原文稍后读已读值得跟进有用关注 MiniMax H3
16:57IT之家(博客/媒体)阿里千问发布语音合成大模型Qwen-Audio-3.0-TTS,包含Flash(首包延时300ms级别)和Plus两个版本。在Artificial Analysis全球榜单中,Qwen-Audio-3.0-TTS-Plus位列第一。模型支持在文本嵌入[gasp]、[giggles]等结构化标签精细控制语气情绪。覆盖中、英、日、韩、德等16种语言及20种方言,音频输出提升至48KHz,单次合成可达3分钟。AI模型Qwen-Audio-3.0-TTS阿里千问语音合成推荐理由:阿里千问新语音模型能通过标签控制语气情绪,支持16种语言和20种方言,48KHz音质,试试让语音笑或生气。原文稍后读已读值得跟进有用关注 Qwen-Audio-3.0-TTS
11:17官方账号Together AI@togethercompute精选GLM 5.2 模型在 Together AI 平台部署后,在 Artificial Analysis 评测中输出速度和延迟均获得第一名。该评测覆盖多个主流模型,GLM 5.2 在吞吐量和响应时间指标上表现领先。Together AI 通过优化推理栈使模型达到接近实时的生成速度。AI模型GLM 5.2Together AIArtificial Analysis推荐理由:GLM 5.2 在 Together AI 上跑出了最快速度和最低延迟,想用低成本跑推理的话可以去试试这个组合。原文稍后读已读值得跟进有用关注 GLM 5.2
18:34官方账号Together AI@togethercomputeTogether AI 部署的 DeepSeek V4 Pro 在 Artificial Analysis 基准测试中同时获得输出速度和延迟两项第一。该成绩通过优化 KV 缓存、前缀复用、内核及端点配置实现。Together AI 公开了其推理系统的具体工程方案,包括缓存策略和内核调优。AI模型DeepSeek V4 ProTogether AIArtificial Analysis1 个信源在谈事件专题推荐理由:Together AI 把 DeepSeek V4 Pro 调到了速度与延迟双第一,还公开了优化方法,搞推理部署的值得看看。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
10:57Viking@vikingmuteGLM5.2在Artificial Analysis开源模型排名中登顶,多项benchmark评分领先。有用户反馈其实际体验接近Opus 4.6,作者考虑将Deepseek V4 Pro替换为GLM5.2。该帖子获得2条回复、505次浏览。AI模型GLM5.2Artificial AnalysisOpus 4.62 个信源在谈事件专题推荐理由:GLM5.2在开源模型排名拿了第一,而且有人说用起来感觉像Opus 4.6,你要是想换掉Deepseek V4 Pro可以试试。原文稍后读已读值得跟进有用关注 GLM5.2
22:18官方账号阶跃星辰 Stepfun@Stepfun_AIStepfun 发布的 StepAudio 2.5 TTS 模型在 Artificial Analysis Speech Arena 盲测中获中文 TTS 最高排名,全球排名前三。该模型在真实听众盲听测试中表现出色,超越了众多国际竞品。这标志着中文语音合成技术已达到全球领先水平,对智能语音助手、有声内容创作等领域具有重要价值。StepAudio 2.5 展现了国产模型在细分赛道上的竞争力。AI模型StepAudio 2.5 TTS语音合成中文TTS推荐理由:StepAudio 2.5 TTS 在公开盲测中击败国际竞品,证明国产TTS模型已具备全球竞争力,对AI语音应用开发者具有参考价值。原文稍后读已读值得跟进有用关注 StepAudio 2.5 TTS