11:44官方账号阿里通义 Qwen@Alibaba_Qwen精选Alibaba's Qwen3.8-27B achieves #9 overall on Code Arena, outperforming models in its size class. The model is 6 ranks behind Qwen3.8-Max and beats Gemma 4-31B. It reshapes the Pareto Frontier.AI模型Qwen3.8-27BCode Arena模型排名1 个信源在谈事件专题推荐理由:Alibaba的Qwen3.8-27B在Code Arena上表现出色,超越同类模型,值得一看!原文稍后读已读值得跟进有用关注 Qwen3.8-27B
10:20官方一手Pandaily@contact@pandaily.com (Pandaily)神秘模型'Ox Alpha'在OpenRouter和OpenCode上免费一周,结束DeepSeek 56天排名第一,创单日使用记录,社区搜寻其创作者。AI模型Ox AlphaDeepSeekOpenCode7 个信源在谈事件专题推荐理由:神秘模型'Ox Alpha'在OpenCode上免费,终结DeepSeek的统治,寻找其创作者,值得关注。原文稍后读已读值得跟进有用关注 Ox Alpha
04:29官方账号NVIDIA AI@NVIDIAAI精选Nemotron 3.5 Lightning在Pinchbench上以86.4%的平均成功率进入开放重量级模型前四,Nemotron 3 Ultra保持第一位置。AI模型Nemotron 3.5 Lightning模型排名Pinchbench推荐理由:NVIDIAAI发布了Nemotron 3.5 Lightning,性能卓越,超越其他模型,值得一看。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
04:26Fish Audio@FishAudioS2.1 Pro Free成为OpenRouter平台上语音模型第一,上周请求达104万次,较一周前增长413%,领先谷歌、微软等多家公司模型。AI模型S2.1 Pro FreeOpenRouter语音模型推荐理由:鱼音频发布了S2.1 Pro Free,成了OpenRouter上语音模型第一,比谷歌等公司模型都强。原文稍后读已读值得跟进有用关注 S2.1 Pro Free
16:14IT之家(博客/媒体)8月17日,Arena平台发布2026年第33周AI大模型盲测排名。Anthropic的claude-opus-4系列新模型密集入榜,claude-fable-5以1506分蝉联综合榜第一,claude-opus-4-6-high以1505分紧随其后。国产模型中,kimi-k3-max以1489分升至综合榜第12位,并在代码榜以1544分排名第6、前端开发榜以1674分保持第2。谷歌gemini-3.7-flash-high首次入榜即获第9名,阿里qwen3.8-max则降至第8名。榜单基于匿名盲测投票ELO分数,反映用户主观偏好。AI模型Anthropicclaude-opus-4kimi-k3-max10 个信源在谈事件专题推荐理由:这周Arena盲测榜变化大,Anthropic新Claude扎堆屠榜,国产kimi-k3-max在代码和前端都紧咬前排,看看具体分数吧。原文稍后读已读值得跟进有用关注 Anthropic
07:05Mustafa Suleyman@mustafasuleyman微软发布 MAI-Image-2.6,在文本到图像竞技场以 1336 分位列第二,仅比第一名的 GPT Image 2 Medium 低 45 分。该成绩领先第三名 Grok Imagine Image 2.0(Low)20 分,相比上一代 MAI-Image-2.5 的 1256 分提升显著。模型将于下周在 Playground 上线,并通过 Foundry 提供早期 API 访问。AI模型MAI-Image-2.6微软GPT Image 22 个信源在谈事件专题推荐理由:微软新出的文生图模型冲到了全球第二,只比 GPT Image 2 差一点,还超过了 Grok 和 Meta,下周就能用 API 了。原文稍后读已读值得跟进有用关注 MAI-Image-2.6
01:17OpenRouter@OpenRouterAIOpenRouter公布了新的模型榜单入口。其rankings页面支持按任务(task)筛选。访问openrouter.ai/rankings即可查看所有模型排名。AI产品OpenRouter模型排名任务分类推荐理由:OpenRouter整理了一个按任务分的模型排行页,想挑模型直接去看,比自己挨个试省事。原文稍后读已读值得跟进有用关注 OpenRouter
02:51lmarena.ai@lmarena_aiArena.ai 发布最新榜单,Kimi K3 (Max) 在 Frontend Code Arena 中以 1682 分排名开放权重第一,同时超越所有闭源模型成为整体第一。它在 Agent Arena 中取得 +9.75% 的净提升,领先 GLM-5.2 (Max) 的 +7.12%,并夺得开放权重组冠军。该模型在 7 个领域中的 5 个获得整体第一,仅在游戏和内容创作工具领域排名第二。Agent Arena 通过数百万真实长程智能体任务评估模型,涉及网页搜索、文件系统和终端工具。AI模型Kimi K3Frontend Code ArenaAgent Arena10 个信源在谈事件专题推荐理由:Kimi K3 (Max) 在代码和智能体测试中双料夺冠,连 GLM-5.2 都比它低一截,开发者和研究者可以关注这个新标杆。原文稍后读已读值得跟进有用关注 Kimi K3
00:09lmarena.ai@lmarena_ai精选73°Arena 新增“事实性”排名信号,基于人类偏好与事实性的加权组合重新排列模型。该团队标注了超过 200 万条来自真实对话的 LLM 声明(Text Arena 130 万+,Search Arena 70 万+),通过验证声明正确性比较模型。开启事实性后,Claude Fable 5 下降至第 2,GPT-5.5 上升 13 位至第 7,Muse Spark 下降 13 位至第 20。Meta 整体从第 2 跌至第 5,Anthropic 仍居第 1;开源模型中,Xiaomi 从第 9 跃至第 6。AI模型ArenafactualityClaude Fable 510 个信源在谈事件专题推荐理由:Arena 现在能看模型在事实准确性上的表现,Claude 和 GPT-5.5 排名变化挺有意思,想挑更靠谱的模型可以看看。原文稍后读已读值得跟进有用关注 Arena
23:38小互@imxiaohu社交媒体用户xiaohu声称Grok 4.5模型性能已进入全球前三,甚至可能第二。该动态同时提及GPT5.6,表示期待其今晚表现。目前Grok 4.5和GPT5.6均未公开详细基准测试数据。AI模型Grok 4.5GPT5.6模型排名推荐理由:有个哥们说Grok 4.5能排世界前二,还预告GPT5.6今晚来,真假难辨但值得围观原文稍后读已读值得跟进有用关注 Grok 4.5
05:03lmarena.ai@lmarena_ai精选xAI 的 Grok Build 0.1 和 Grok 4.3 (High) 在最新的 Agent Arena 排行榜中分别位列第15和第17名。Grok Build 0.1 在 bash 能力上有明显提升,但可操控性稍差且更容易出现工具幻觉,不过整体任务完成率更高。Agent Arena 使用因果追踪方法对模型在真实世界智能体任务中的表现进行排名。该排行榜基于全球用户社区提交的真实任务,从5个信号维度评估模型表现。AI模型智能体GrokxAI推荐理由:xAI 的模型在 Agent Arena 中取得不错排名,做智能体开发和自动化任务的团队可以看看 Grok Build 0.1 在 bash 能力上的改进,值得关注其实际任务完成率提升。原文稍后读已读值得跟进有用关注 智能体
03:38Paul Couvert@itsPaulAi微软发布了一款新的图像编辑模型,在单图编辑任务上排名第二,仅次于GPT-Image-2,同时在文生图和文字渲染任务上分别排名第三。该模型经过数天测试,表现令人惊讶,但目前仅支持单图上传编辑,不支持多图编辑。这一发布表明微软在图像生成与编辑领域正快速追赶领先者。AI模型图像编辑微软文生图5 个信源在谈事件专题推荐理由:图像编辑开发者或AI绘画爱好者可以关注这款新模型,它提供了接近GPT-Image-2的编辑质量,且目前免费可用,值得一试。原文稍后读已读值得跟进有用关注 图像编辑
00:43OpenRouter@OpenRouterAIOpenRouter 发布了图像输出模型的最新排名,显示 GPT Image 2 在上周表现突出,获得了大量关注和互动。该排名基于社区使用和反馈数据,反映了当前图像生成模型的热度趋势。GPT Image 2 的快速增长表明其在图像生成质量和效率上获得了用户认可。这一排名为开发者和创作者选择图像生成工具提供了参考。AI产品图像生成GPT Image 2OpenRouter推荐理由:做图像生成或 AI 内容创作的团队,可以看看哪个模型当前最火、用户反馈最好,直接参考排名选模型试试。原文稍后读已读值得跟进有用关注 图像生成
08:05lmarena.ai@lmarena_aiHiDream AI 推出的 HiDream-01-Image 模型在 Text-to-Image Arena 中综合排名第27,成为排名第4的开源文生图模型。该模型在开源社区中表现出色,超越了多数同类开源模型,展示了 HiDream AI 在图像生成领域的实力。这一成绩意味着开发者可以免费使用接近闭源顶尖水平的文生图能力。AI模型文生图开源模型HiDream-01-Image推荐理由:开源文生图模型又添猛将,HiDream-01-Image 排名第4,做图像生成应用的团队可以直接拿来用,性价比很高。原文稍后读已读值得跟进有用关注 文生图