01:41lmarena.ai@lmarena_ai精选Meta 发布了 Muse Spark 1.2 (xHigh) 模型。该模型在 Agent Arena 基准测试中实现了 +2.1% 的净提升。相比前代 Muse Spark 1.1,其净提升分数从 0.9% 提升至 2.1%。在 Bash Recovery 任务上,性能从 +5.9% 提升到 +11.4%。AI模型Muse SparkMetaAgent Arena推荐理由:Meta 刚刚发布了 Muse Spark 1.2 (xHigh),在 Agent Arena 上的净提升分数从 0.9% 提升到了 2.1%,Bash Recovery 任务直接翻倍,比前代强了不少。原文稍后读已读值得跟进有用关注 Muse Spark
01:37lmarena.ai@lmarena_aiAgent Arena 排行榜衡量模型在数百万个真实世界、长周期任务中的表现。模型可使用网络搜索、文件系统和终端工具完成复杂工作流。该榜单通过因果追踪方法,衡量模型相对于平均模型的结果表现。AI模型Agent Arenaarena.ai智能体推荐理由:看看 arena.ai 上新出的 Agent Arena 排行榜,它用真实任务测试模型,还能用工具,比普通测试更实用。原文稍后读已读值得跟进有用关注 Agent Arena
07:36lmarena.ai@lmarena_ai精选Agent Arena推出新模型评测标准,基于百万级真实世界长期任务;利用因果追踪方法测试模型在网页搜索等工具的复杂流程;通过与平均模型对比评估任务效果。AI模型Agent Arena模型评测工具测试推荐理由:Agent Arena发布了新模型评测标准,用多种工具测模型实际能力,比普通评测更全面。原文稍后读已读值得跟进有用关注 Agent Arena
07:36lmarena.ai@lmarena_ai精选76°DeepSeek - V4 - Pro (High) 以+6%净提升成为开放模型领域Agent Arena第2名;与DeepSeek - V4 - Flash (High) 相比,其性能更高且任务成本更低;在代码和工作类别排名第2,聊天类第5,多项指标表现突出。generalDeepSeek - V4 - Pro (High)Agent ArenaDeepSeek - V4 - Flash (High)推荐理由:DeepSeek发布的V4 - Pro (High),比前代版本强,成本还低,在开放模型里排第二,可以去试试。原文稍后读已读值得跟进有用关注 DeepSeek - V4 - Pro (High)
03:31lmarena.ai@lmarena_aiAgent Arena对比了15款模型任务成本,Kimi K3 (Max)每任务成本仅$0.62;Claude Opus 5 (Max)成本达$3.37,与同类存在明显差距;Kimi K3 (Max)排名第4,成本远低于多数同级别模型;Grok和Qwen以较低成本实现了不错表现。AI模型Agent ArenaKimi K3Claude Opus 57 个信源在谈事件专题推荐理由:Agent Arena发布了各模型任务成本对比,能清楚看到不同模型花多少钱和效果,和同类比啥不一样。原文稍后读已读值得跟进有用关注 Agent Arena
01:49lmarena.ai@lmarena_aiAgent Arena 推出了新的分类功能。用户可以通过 arena.ai/leaderboard/ag… 网址在线尝试这些新分类。该推文发布后获得了889次浏览。AI产品Agent Arena智能体多模态推荐理由:Agent Arena 上线了新分类,你可以去 arena.ai/leaderboard 看看,体验一下新功能。原文稍后读已读值得跟进有用关注 Agent Arena
07:17lmarena.ai@lmarena_ai精选71°Agent Arena 新增代码、工作、聊天三个分类榜单。代码榜第一是 OpenAI 的 GPT 5.6 Sol(xHigh)。工作榜和聊天榜第一均为 Anthropic 的 Claude Opus 5(High 和 Max)。该评测基于数百万真实长时程智能体任务,单次长会话成本可达数百至一千美元。AI模型Agent ArenaGPT 5.6Claude Opus 510 个信源在谈事件专题推荐理由:想知道代码、工作、聊天分别谁最强?Agent Arena 新榜单给出答案:GPT 5.6 和 Claude Opus 5 各领风骚。原文稍后读已读值得跟进有用关注 Agent Arena
03:45lmarena.ai@lmarena_ai智谱(Z.ai)推出GLM-5.3,基于743B基础模型进行后训练,主打编码和智能体能力。该模型已上线Agent Arena,接受基于数百万真实长程任务的评测,可调用网页搜索、文件系统和终端工具。官方称其在网络安全上取得重大提升,成为开源模型新标准。AI模型GLM-5.3Z.aiAgent Arena10 个信源在谈事件专题推荐理由:GLM-5.3已进Agent Arena,743B大模型主打编码和网络安全,可以拿你的难题去投票测一测。原文稍后读已读值得跟进有用关注 GLM-5.3
02:47lmarena.ai@lmarena_ai精选Agent Arena完整排行榜详情已在官网公开,页面地址为arena.ai/leaderboard。官方通过X平台账号发布了链接,该推文目前已有1233次浏览,并附带1张数据图表。用户可前往页面查看各智能体的具体排名与表现。AI模型Agent Arena智能体评测基准推荐理由:想看AI智能体谁强谁弱?Agent Arena完整榜单出来了,去arena.ai/leaderboard就能看。原文稍后读已读值得跟进有用关注 Agent Arena
02:24lmarena.ai@lmarena_ai72°Google DeepMind的Gemini 3.7 Flash (High)在Agent Arena取得+3.4%净提升。整体排名第20,高于Gemini 3.6 Flash (High)的第35名。长程智能体任务表现与Claude Sonnet 4.6和GPT-5.6 Terra (xHigh)处于同一区间。其Confirmed Success信号得分提升10%,位列第5。官方称该模型在编码、知识工作和网页开发方面更强。AI模型Gemini 3.7 FlashGoogle DeepMindAgent Arena推荐理由:谷歌新出的Gemini 3.7 Flash在智能体评测里冲到第20,比上代强一截,编码和网页开发更好用了,感兴趣的可以试试。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
17:56IT之家(博客/媒体)韩国 Upstage 发布商用大模型 Solar Pro 4,上下文窗口 512K,输出长度 128K token。定价方面,输入每百万 tokens 0.3 美元,缓存读取 0.06 美元,输出 1.2 美元。该模型在 Terminal-Bench v2.1 得分 57,τ³-Banking 得分 23,AA-LCR 得分 71。在 Agent Arena 榜单排名第 44,与 MiniMax M2.7 同级,也是首个登上该榜单的韩国实验室模型。AI模型Solar Pro 4UpstageAgent Arena推荐理由:Upstage 发了主打智能体任务的 Solar Pro 4,定价不高,Agent Arena 排名和 MiniMax M2.7 同级,适合处理长文档和多轮工具调用。原文稍后读已读值得跟进有用关注 Solar Pro 4
10:01lmarena.ai@lmarena_ai精选Upstage 发布 Solar Pro 4,成为首个登上 Agent Arena、Code Arena: WebDev 和 Text Arena 榜单的韩国实验室模型。Solar Pro 4 在 Agent Arena 排名第 44,与 MiniMax M2.7 和 Nemotron 3 Ultra 并列,整体净改进得分为 -12.10%。该模型在 GDPval-AA 得分为 39,τ³-Banking 为 23,Terminal-Bench 2.1 为 57,定价为每百万 tokens 0.30 美元(输入)和 1.20 美元(输出),缓存价格 0.06 美元,优惠 90% 至 9 月 10 日。AI模型Solar Pro 4UpstageAgent Arena推荐理由:Upstage 的 Solar Pro 4 是首个登上多个 Arena 榜单的韩国模型,适合做生产级智能体,价格便宜,值得试试。原文稍后读已读值得跟进有用关注 Solar Pro 4
09:46lmarena.ai@lmarena_ai精选Agent Arena发布新评测基准,在数百万个真实世界长程智能体任务上衡量模型表现。评测中模型需使用网络搜索、文件系统和终端工具完成复杂工作流,包括编写代码、制作幻灯片、网络研究、构建应用和文档分析。该基准采用因果追踪方法,可深入分析模型在长程任务中的决策过程。评测结果已上线arena.ai/leaderboard/ag榜单。AI模型Agent Arena智能体评测基准推荐理由:想测智能体真实干活能力?Agent Arena用百万真实任务打分,比普通聊天评测靠谱多了。原文稍后读已读值得跟进有用关注 Agent Arena
04:00lmarena.ai@lmarena_aiAgent Arena 发布了因果追踪方法论的解读文章。因果追踪能定位智能体决策时的关键内部状态。Agent Arena 的这套方法旨在解释智能体为何在竞技场中做出某类选择。论文Agent Arenacausal tracing智能体推荐理由:Agent Arena 把怎么用因果追踪看清智能体行为的方法讲透了,做智能体评估或研究模型机制的人可以看看。原文稍后读已读值得跟进有用关注 Agent Arena
03:59lmarena.ai@lmarena_aiAgent Arena追踪模型完成真实任务所需的token数量。Opus系列从4.7到5,性能持续提升,但token消耗从约8.5k增至约21k,含推理和输出token。相反,GPT-5.5到GPT-5.6-Sol的token用量从约10k降至约8k,同时净改进提升约1.5pp。两组模型在效率与性能上呈现相反趋势。AI模型Agent ArenaOpus 5GPT-5.6-Sol7 个信源在谈事件专题推荐理由:看Opus 5和GPT-5.6-Sol在同一基准上的表现,一个越强越费token,一个越强越省,挺有意思的对比。原文稍后读已读值得跟进有用关注 Agent Arena
07:05lmarena.ai@lmarena_aiMeta 的 Muse Spark 1.2 模型正式进入 Agent Arena,参与数百万个真实世界长程代理任务的评测。该模型可调用网页搜索、文件系统和终端工具来完成复杂工作流。除 Agent Arena 外,Muse Spark 1.2 还出现在 Text、Vision 和 Code Arena: Frontend 中。同期发布的 Muse Code(beta)是面向长程软件工程的终端编码代理,能基于 Muse Spark 1.2 规划并验证跨多文件的代码修改。AI模型Muse SparkMuse CodeMeta10 个信源在谈事件专题推荐理由:Meta 把 Muse Spark 1.2 放进 Agent Arena 让大家拿难题测它,还出了个终端编码代理 Muse Code,能干多文件改代码的活,可以去试试。原文稍后读已读值得跟进有用关注 Muse Spark
09:41lmarena.ai@lmarena_aiAgent Arena 排行榜已上线,用户可访问 arena.ai/leaderboard 查看完整数据。该榜单提供智能体在各类任务中的表现对比,包含具体评分与排名。评测结果由 Arena 平台公开,供开发者与研究者参考。AI产品Agent Arena智能体排行榜推荐理由:想选个好用的智能体?去 Agent Arena 排行榜看看,直接比分数挑,省得自己挨个试。原文稍后读已读值得跟进有用关注 Agent Arena
09:38lmarena.ai@lmarena_ai精选DeepSeek-V4-Flash-20260731 (High)在Agent Arena中排名第21,净改进+1.98%,在开源模型中位列第3,基于12.5K次真实智能体会话。该模型每次任务的中位成本为0.024美元,低于GPT-5.6 Luna (xHigh)的0.026美元,但高于DeepSeek-V4-Pro (Thinking)的0.020美元。在各项信号中,Confirmed Success得分+6.99%,而Steerability为-2.31%。其排名比DeepSeek-V4-Pro高6位,比之前的DeepSeek-V4-Flash高13位。AI模型DeepSeek-V4-FlashAgent ArenaGPT-5.6 Luna9 个信源在谈事件专题推荐理由:DeepSeek新模型V4-Flash跑Agent任务每单只要0.024美元,比GPT-5.6 Luna还便宜,性价比很能打。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
23:41lmarena.ai@lmarena_ai74°Agent Arena 使用数百万个真实世界长程智能体任务评测模型。模型获得网页搜索、文件系统和终端工具,完成写代码、制作幻灯片、网络研究、构建应用和分析文档等工作流。评测采用因果追踪方法衡量模型的净改进,即相对平均模型提升结果的程度。完整排行榜见 arena.ai/leaderboard/ag…。AI模型Agent Arena智能体模型评测推荐理由:想知道哪个模型最能搞定真实长任务?Agent Arena 用几百万个任务跑分,还给模型上网、文件、终端工具,比谁净提升大。原文稍后读已读值得跟进有用关注 Agent Arena
23:39lmarena.ai@lmarena_ai精选DeepSeek 发布 DeepSeek-V4-Flash-20260731(High)版本,在 Agent Arena 综合排名第 21,净提升 +1.98%,开源模型中位列第 3。该成绩基于 12.5K 次真实智能体会话评估,比 DeepSeek-V4-Pro 高 6 位(-0.47%),比上一代 V4-Flash 高 13 位(-2.81%)。分项信号中 Confirmed Success 达到 +6.99%,而 Steerability 为 -2.31%。官方 API 同步开放公开测试,原生支持 Responses API 格式,并已适配 Codex。AI模型DeepSeek-V4-FlashAgent Arena智能体9 个信源在谈事件专题推荐理由:DeepSeek 新模型在 Agent Arena 排开源第三,API 上线且支持 Codex,做智能体可以试试。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
02:26lmarena.ai@lmarena_ai精选斯坦福博士生与Arena研究员@carrieeeeet提出一套框架,在历史任务上校准合成数据,避免依赖当前任务的真实标签。该方法覆盖社会科学调查、AI评估和Agent Arena排行榜早期信号,处理源于模型、时间和环境变化的系统偏差。核心通过任务可交换性(Task Exchangeability)从相邻任务学习,World Cup案例用于解释原理。案例还包括Bradley-Terry/AutoRater评分和Agent Leaderboard上的可操控性分数。论文Agent Arena合成数据校准推荐理由:斯坦福Carrie的新框架,用历史任务校准合成数据,不需要真实标签,Agent Arena也在用,能解决模型和时间带来的偏差。原文稍后读已读值得跟进有用关注 Agent Arena
00:35lmarena.ai@lmarena_ai81°DeepSeek-V4-Flash 已进入 Agent Arena,将在数百万个真实长程智能体任务中接受评测,任务可调用网页搜索、文件系统和终端工具。官方同步开放 V4-Flash API 公测,称其智能体能力大幅升级,基准得分已明显超过 V4-Pro-Preview。新版 API 原生支持 Responses API 格式,并已适配 Codex。该模型还将在 Frontend Code Arena、Text 和 Vision Arena 中评测,具体分数待公布。AI模型DeepSeek-V4-FlashDeepSeek智能体10 个信源在谈事件专题推荐理由:DeepSeek 把 V4-Flash 放进 Agent Arena,API 公测也开了,智能体跑分超过 V4-Pro-Preview,还适配 Codex,想试的可以看看。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
06:11lmarena.ai@lmarena_aiAgent Arena 的评分基于数百万来自全球用户的真实长期智能体任务。模型可使用网络搜索、文件系统和终端工具完成复杂工作流。排行榜使用因果追踪方法测量模型相对于平均模型的结果表现。详细方法可在 arena.ai/leaderboard/ag 查看。AI模型Agent Arena智能体基准测试推荐理由:想知道你的模型在真实任务里啥水平?Agent Arena 用数百万实际任务和工具调用测试,结果很客观。原文稍后读已读值得跟进有用关注 Agent Arena
02:32lmarena.ai@lmarena_aiAnthropic 的 Claude Opus 5 (Max) 在 Agent Arena 中以 11.88% 净改进率位居第二,紧随其后的 Opus 5 (High) 以 11.73% 位列第三。该排名基于超过 7,000 次真实世界智能体会话,且 Opus 5 Max 在 Confirmed Success 和 Praise vs Complaint 信号上均获得第一。默认版本 Opus 5 (High) 在 Praise vs Complaint 信号排第三,在 Confirmed Success 信号排第四。Agent Arena 通过数百万个长期任务评估模型的工具调用和复杂工作流完成能力。AI模型Claude Opus 5Agent ArenaAnthropic10 个信源在谈事件专题推荐理由:Anthropic 的 Opus 5 在 Agent Arena 上超过 GPT-5.6,你也能用自己提示词在 agent 模式里测试它。原文稍后读已读值得跟进有用关注 Claude Opus 5
01:00lmarena.ai@lmarena_ai82°OpenAI 的 GPT 5.6 Sol (xHigh) 在 Agent Arena 中排名第四,而 Anthropic 的 Claude Opus 5 (Max) 以 11.88% 的净提升位列第二,Opus 5 (High) 以 11.73% 净提升位列第三。Opus 5 Max 在 Confirmed Success 和 Praise vs Complaint 信号上均排名第一。Fable 5 (High) 在性价比上表现最优。Arena.ai 基于超过 7000 次真实世界智能体会话得出排名。AI模型Claude Opus 5GPT 5.6Agent Arena10 个信源在谈事件专题推荐理由:想比较 Claude Opus 5 和 GPT 5.6 在真实智能体任务上的表现?这份报告用 7000+ 次任务告诉你谁更强、谁更划算。原文稍后读已读值得跟进有用关注 Claude Opus 5
00:15lmarena.ai@lmarena_ai82°Anthropic 的 Claude Opus 5 (Max) 在 Agent Arena 中排名第二,基于超过 7000 次真实代理会话,净提升 11.88%。Opus 5 (High) 紧随其后排名第三,净提升 11.73%,两者均低于第一名 Fable 5,但高于 GPT-5.6 Sol (xHigh)。在 Frontend Code Arena 中,Opus 5 Max 排名第一,Opus 5 High 排名第三(落后于 Kimi K3)。在 Text Arena(事实性开启)中,Opus 5 Max 位列第一,Opus 5 High 第二。这些成绩基于全球社区的百万级真实长周期任务评测。AI模型Claude Opus 5Agent ArenaAnthropic10 个信源在谈事件专题推荐理由:Claude Opus 5 在 Agent Arena 和代码榜都冲进前三,Max 版更是双榜第一,比 GPT-5.6 还靠前,很强悍。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:00lmarena.ai@lmarena_aixAI宣布Grok 4.6将于8月7日发布,下周将在Arena亮相。同时,Grok-4.5在Agent Arena排行榜上基于9.8K次实时代理会话获得第13名,相比Grok 4.3的第29名有显著提升。Grok-4.5在Bash Recovery任务上取得重大进展,追赶上了Anthropic和OpenAI的模型,确认任务成功率大幅提高。这一排名显示了Grok系列在代理性能上的进步。AI模型GrokAgent Arena推理模型10 个信源在谈事件专题推荐理由:xAI发了Grok 4.6发布预告,同时4.5在Agent Arena上冲到了第13名,比4.3进步了16名,尤其Bash Recovery能力追上了Claude和GPT,推荐关注。原文稍后读已读值得跟进有用关注 Grok
06:11lmarena.ai@lmarena_ai精选GPT-5.6 的 Sol、Terra、Luna 三个变体在 Agent Arena 中以 xHigh 设置进行测试。Sol 以 +10.1% 的净改进位列排行榜第二。Terra (+4.0%) 和 Luna (+3.3%) 也取得正向提升,与 Claude Opus 4.8 (+3.5%) 的水平相当。AI模型GPT-5.6Agent ArenaSol推荐理由:GPT-5.6 的 Sol 版在 Agent Arena 上表现亮眼,比 Terra 和 Luna 都强,直接对标 Claude Opus 4.8。想了解新模型实力的话可以看看。原文稍后读已读值得跟进有用关注 GPT-5.6
06:06lmarena.ai@lmarena_ai精选GPT-5.6 Terra和Luna(xHigh变体)加入Agent Arena,基于全球社区的真实智能体会话排名第15和第17。在推理努力从低到高时所有变体均有提升,但低推理时Terra持平,Luna下降5.1%。效率前沿显示Luna xHigh(+3.3%)略优于Terra Medium(+3.1%)和Low(+1.2%),更便宜的模型通过更多推理努力可超越昂贵模型。同时GPT-5.6 Sol排名第2,基于7.8K会话,对比GPT-5.5 xHigh净提升1.6%,差距缩小,与Claude Fable 5的“表扬vs抱怨”信号得分分别为+10.9%和+17.3%。AI模型GPT-5.6OpenAIAgent Arena10 个信源在谈事件专题推荐理由:OpenAI的GPT-5.6新变体在真实任务基准中表现具体,小模型靠更多推理能超越大模型,值得关注沙箱数据。原文稍后读已读值得跟进有用关注 GPT-5.6
02:54lmarena.ai@lmarena_aiKimi K3 (Max) 在 Agent Arena 中以 +9.75% 的净提升率超越 GLM-5.2 (Max) 的 +7.12%,成为开源权重模型第一名,并在 Frontend Code 竞技场(1682 分)和 Text 竞技场(1485 分)同样拔得头筹。该模型为 2.8T MoE 架构,支持原生视觉理解与 1M 上下文窗口,号称每单位计算智能提升 2.5 倍。Kimi 团队同步开源模型权重、高性能注意力核、MoE 通信库及代理运行基础设施。AI模型Kimi K3GLM-5.2Moonshot10 个信源在谈事件专题推荐理由:Kimi 开源了 K3 模型,Agent Arena 直接干翻 GLM-5.2,净提升超 9%,代码和文本竞技场也是第一,值得关注。原文稍后读已读值得跟进有用关注 Kimi K3
02:52lmarena.ai@lmarena_aiAgent Arena 推出智能体性能排行榜,使用因果追踪技术分析模型决策路径。排行榜在 arena.ai 页面公开,提供详细方法论说明。该榜单旨在提升智能体评测的透明度和可解释性。AI模型Agent Arena因果追踪智能体推荐理由:想知道AI智能体谁最强?Agent Arena 新出了排行榜,还教你怎么用因果追踪看模型决策,挺有意思。原文稍后读已读值得跟进有用关注 Agent Arena
02:51lmarena.ai@lmarena_aiArena.ai 发布最新榜单,Kimi K3 (Max) 在 Frontend Code Arena 中以 1682 分排名开放权重第一,同时超越所有闭源模型成为整体第一。它在 Agent Arena 中取得 +9.75% 的净提升,领先 GLM-5.2 (Max) 的 +7.12%,并夺得开放权重组冠军。该模型在 7 个领域中的 5 个获得整体第一,仅在游戏和内容创作工具领域排名第二。Agent Arena 通过数百万真实长程智能体任务评估模型,涉及网页搜索、文件系统和终端工具。AI模型Kimi K3Frontend Code ArenaAgent Arena10 个信源在谈事件专题推荐理由:Kimi K3 (Max) 在代码和智能体测试中双料夺冠,连 GLM-5.2 都比它低一截,开发者和研究者可以关注这个新标杆。原文稍后读已读值得跟进有用关注 Kimi K3
02:50lmarena.ai@lmarena_aiKimi K3 (Max)在Agent Arena开放权重模型榜单中取得#1开放和#1总体成绩。在Praise vs. Complaints维度排名#1开放和#4总体,Steerability维度#1开放和#5总体,Bash Recovery维度#1开放和#15总体。该模型在工具幻觉测试中记录为0次。AI模型Kimi K3Agent Arena开放权重模型10 个信源在谈事件专题推荐理由:Kimi的K3 (Max)在Agent Arena开放权重组拿了第一,整体也第一,工具零幻觉,挺能打。原文稍后读已读值得跟进有用关注 Kimi K3
02:16lmarena.ai@lmarena_ai82°Anthropic发布Claude Opus 5,在静态基准上达到Fable 5级智能。该模型在Agent Arena中接受数百万真实世界长时任务测试,可使用网络搜索、文件系统和终端工具。还将进入Frontend Code Arena、Text、Vision和Document Arena评估。价格仅为Fable 5的一半。具体分数即将公布。AI模型Claude Opus 5AnthropicFable 510 个信源在谈事件专题推荐理由:Anthropic新模型Claude Opus 5静态能力追平Fable 5,价格只要一半,还要在Agent Arena测真实任务,值得蹲分数。原文稍后读已读值得跟进有用关注 Claude Opus 5
18:13Hunyuan@TXhunyuan腾讯混元发布Hy3模型,在Arena.ai的Agent Arena中位列总榜第25名,开源权重模型中排第5。在Frontend Code Arena中排名开源模型第2、总榜第16。Agent Arena基于百万级真实长周期智能体任务评测,Hy3在工具使用(CLI/bash错误恢复)上净提升+2.6%,排名第25;可操纵性是其最大弱点,净提升-7.1%,排名第30。AI模型Hy3Tencent HunyuanAgent Arena推荐理由:腾讯混元Hy3在Agent Arena和代码榜单上表现不错,工具使用能力尤其突出,适合关注开源智能体模型的朋友看。原文稍后读已读值得跟进有用关注 Hy3
06:43lmarena.ai@lmarena_aiChatbot Arena 推出了 Agent Arena 和 Frontend Code Arena 两个新排行榜。Agent Arena 评估 AI 智能体在真实世界任务中的表现,Frontend Code Arena 专门评测模型的前端代码生成能力。排行榜数据来自用户对战投票,结果实时更新在 arena.ai 上。AI模型Agent ArenaFrontend Code Arena智能体推荐理由:想看看哪个 AI 智能体干活最靠谱、哪个写前端代码最好?这两个新排行榜给你真实用户投票结果,直接去 arena.ai 查。原文稍后读已读值得跟进有用关注 Agent Arena
06:43lmarena.ai@lmarena_ai77°腾讯的Hy3模型在Agent Arena中排名开源模型第5(总体第25),在Frontend Code Arena中排名开源模型第2(总体第16)。模型在工具使用方面表现突出,从CLI/bash错误恢复能力使净得分+2.6%(排名第25),但在可调节性方面较弱,用户反驳时纠正困难,得分为-7.1%(排名第30)。Hy3为295B参数的MoE架构,采用Apache 2.0许可,适合商业使用,并提供两周免费API。Agent Arena基于数百万真实世界长期智能体任务评估模型,使用因果追踪方法衡量净改进。AI模型Hy3TencentAgent Arena推荐理由:腾讯Hy3在智能体基准里表现不错,工具使用能力很强,而且开源可商用,还免费试用两周,值得试试。原文稍后读已读值得跟进有用关注 Hy3
04:23lmarena.ai@lmarena_aiAgent Arena 发布了 Inkling 的评分。具体分数可在排行榜链接中查看。该排行榜展示了多个智能体的表现对比。AI模型InklingAgent Arena智能体推荐理由:Agent Arena 刚更新了 Inkling 的分数,想看看它和其他智能体比怎么样?直接点链接进去。原文稍后读已读值得跟进有用关注 Inkling
03:55lmarena.ai@lmarena_ai精选Inkling在Agent Arena开源模型中排名第9,总分第30,是美国唯一进入前10的开源模型。它在CLI错误恢复方面表现突出(+6.4%,第16),但用户情感分仅-18.0%(第38),可操控性第35,任务完成第29。此外,Inkling在Frontend Code Arena开源模型中排名第10,总分第37,品牌营销领域第4、数据与分析第7。若Kimi K3按计划于7月27日发布权重,将成为排名第一的开源模型,使其他模型顺延一位。AI模型InklingAgent Arenathinkymachines10 个信源在谈事件专题推荐理由:Inkling是当前美国最强的开源模型,在Agent Arena排第9,擅长处理复杂工作流和CLI错误恢复,但用户反馈一般,你可以试试看它是否适合你。原文稍后读已读值得跟进有用关注 Inkling
03:54lmarena.ai@lmarena_aiInkling 在 Agent Arena 排行榜中位列开放模型第9名,总体第30名,总分相较之前提升 9.6%。它在 Bash Recovery 任务中排名第18,提升 6.4%;Confirmed Task Success 排名第29,下降 5.6%;Tool Hallucination 排名第35,下降 0.9%;Steerability 排名第35,下降 10.4%;Praise vs. Complaint 排名第38,下降 18.0%。AI模型InklingAgent Arena开源模型推荐理由:Inkling 这个开源模型在 Agent Arena 里表现不错,Bash Recovery 尤其亮眼,想看看它和其他模型差距的可以关注。原文稍后读已读值得跟进有用关注 Inkling