12:05官方账号Greg Brockman@gdbOpenAI 联合创始人 Greg Brockman 公布 GPT-5.6 成功解决了概率论中长期未解决的 Feige 1/e 猜想。该猜想涉及独立非负随机变量 X_i(期望 ≤1)的部分和 S_n,断言 P(S_n ≤ E[S_n] + 1) ≥ 1/e。Brockman 的友人 Zhengqing 使用 GPT-5.6 完成了这一证明,该问题曾是他们午餐时反复讨论的难题。AI模型GPT-5.6Feige 1/e 猜想推理模型10 个信源在谈事件专题推荐理由:GPT-5.6 刚又搞定一个数学难题,这次是概率论里老牌的 Feige 猜想,你可以看看 AI 证明数学定理有多猛。原文稍后读已读值得跟进有用关注 GPT-5.6
11:05idoubi@idoubicc72°MCP 协议推出第五个大版本(2026-07-28),核心将从有状态双向协议变为无状态请求/响应协议,每个请求自带版本和客户端信息,可负载均衡到多个实例,支持 serverless 和 CDN 部署。新增 MRTR(多轮往返请求)机制,允许服务端中途要求用户确认,如 Supabase 在项目创建前展示费用。请求头新增 Mcp-Method 和 Mcp-Name 字段,防火墙可据此路由而无需解析 JSON。废弃 Roots、Sampling、Logging 及旧版 HTTP+SSE,提供至少 12 个月过渡期。AWS 的 Bedrock AgentCore、Microsoft Foundry、Cloudflare Workers、Google Cloud 等已宣布支持新规范。AI模型MCP无状态负载均衡推荐理由:MCP 终于去掉会话 ID 了,部署起来像普通 HTTP 一样灵活。还有 MRTR 解决中途确认问题,很实用。如果你在生产环境用 MCP,得仔细看迁移指南。原文稍后读已读值得跟进有用关注 MCP
08:20Fireworks AI@FireworksAI_HQFireworks宣布支持对Kimi K3进行微调。Kimi K3是首个3万亿参数的开源前沿模型。通过Training API,用户可进行监督微调、偏好微调和强化学习。训练支持专用和无服务器两种模式,适合产品化部署。AI模型Kimi K3Fireworks微调10 个信源在谈事件专题推荐理由:Fireworks现在可以微调Kimi K3了,3万亿参数的开源模型,支持多种训练方式,适合定制产品。原文稍后读已读值得跟进有用关注 Kimi K3
06:37官方账号Fei-Fei Li@drfeifei精选斯坦福李飞飞团队推出R2S2R仿真引擎,借助生成式世界模型将单个物理任务转化为多个可控、可复用的虚拟世界。该引擎帮助机器人团队训练策略模型,加速测试变更流程,并更早发现故障。相比直接在硬件上实验,可显著降低成本和风险。AI模型R2S2R生成世界模型机器人仿真1 个信源在谈事件专题推荐理由:李飞飞团队出了个R2S2R引擎,用生成世界模型把真实任务变成虚拟世界,机器人训练测试更快更省钱,值得一看。原文稍后读已读值得跟进有用关注 R2S2R
03:50Ideogram@ideogram_aiIdeogram 发布了 Ideogram 4.0,一个 9.3B 参数的扩散 Transformer 模型,该模型为开源权重。在 LMArena 和 Design Arena 基准测试中,Ideogram 4.0 超过了所有其他开源权重图像模型。其 X-Omni 英文 OCR 文本渲染得分达到 0.97,而行业平均水平仅为 0.30–0.50。该模型由 AMD Instinct MI350X GPU(288 GB HBM3 内存和 8 TB/s 带宽)驱动,实现了大规模推理吞吐量。AI模型IdeogramIdeogram 4.0AMD推荐理由:Ideogram 4.0 在所有开源图像模型中跑分最高,文字渲染精度碾压同行,想用开源模型做高质量出图可以试试它。原文稍后读已读值得跟进有用关注 Ideogram
03:02官方账号Anthropic@AnthropicAI精选Anthropic 与苏黎世联邦理工学院、特拉维夫大学和海法大学合作开发了 CryptanalysisBench,这是一个专门评估 LLM 密码分析能力的基准。该基准旨在系统测试模型在经典密码学任务上的表现,例如破解简单加密、识别加密算法等。相关论文已发布在 arXiv (2607.18538)。AI模型AnthropicCryptanalysisBench推理模型10 个信源在谈事件专题推荐理由:Anthropic 和欧洲几所高校搞了个新基准,专门测大模型破解密码的本事,比单纯看推理能力更有针对性。原文稍后读已读值得跟进有用关注 Anthropic
02:28官方一手@OpenAIDevs@OpenAIDevs精选GPT-Transcribe 在 Context Aware ASR 基准上,语义准确率从无自由格式上下文时的 41.6% 提升至 45.2%。在 Common Voice 的 22 种语言上,GPT-Transcribe 转录错误率为 19.27%,而 Whisper(whisper-1)为 40.37%。在 Real-World Audio Recording 基准的 9 种语言上,GPT-Transcribe 错误率为 8.98%,Whisper 为 15.21%。AI模型GPT-TranscribeWhisperASR推荐理由:OpenAI 发的 GPT-Transcribe 在音频转录上比 Whisper 错误率低一半,多语言场景提升明显。原文稍后读已读值得跟进有用关注 GPT-Transcribe
02:08Fish Audio@FishAudio71°Fish Audio完成5200万美元种子轮融资并正式发布S2.1 Pro模型。该模型可从5秒音频克隆声音,速度比Cartesia快2倍,成本仅为Eleven Labs的1/6。支持词级别控制情感、语调和节奏。已被HeyGen、LiveKit等头部AI公司采用。公司承诺若无法帮企业削减语音AI成本50%,则免费提供一年服务。AI模型Fish AudioS2.1 Pro语音克隆1 个信源在谈事件专题推荐理由:Fish Audio刚拿到5200万美元融资,推出S2.1 Pro,5秒克隆声音,比Cartesia快两倍,成本只有Eleven Labs六分之一,还能精细调情绪语调。做语音AI的可以试试。原文稍后读已读值得跟进有用关注 Fish Audio
02:00lmarena.ai@lmarena_aixAI宣布Grok 4.6将于8月7日发布,下周将在Arena亮相。同时,Grok-4.5在Agent Arena排行榜上基于9.8K次实时代理会话获得第13名,相比Grok 4.3的第29名有显著提升。Grok-4.5在Bash Recovery任务上取得重大进展,追赶上了Anthropic和OpenAI的模型,确认任务成功率大幅提高。这一排名显示了Grok系列在代理性能上的进步。AI模型GrokAgent Arena推理模型10 个信源在谈事件专题推荐理由:xAI发了Grok 4.6发布预告,同时4.5在Agent Arena上冲到了第13名,比4.3进步了16名,尤其Bash Recovery能力追上了Claude和GPT,推荐关注。原文稍后读已读值得跟进有用关注 Grok
01:15lmarena.ai@lmarena_ai精选Code Arena 新增全栈开发能力评测,涉及多步推理、工具调用和端到端应用生成。Kimi K3 (Max) 排名第一,GPT 5.6 Sol (xHigh) 第二,Claude Fable 5 第三。榜单完整排名可在 arena.ai 查看。AI模型Kimi K3GPT 5.6 SolClaude Fable 510 个信源在谈事件专题推荐理由:Code Arena 刚上线了全栈能力排行榜,Kimi K3 拿了第一,GPT 5.6 和 Claude Fable 紧随其后,想比模型写代码能力的可以看看。原文稍后读已读值得跟进有用关注 Kimi K3
01:12elvis@omarsar0一位用户对比了两个模型的表现,指出某个未具名模型在构建复杂世界、动画和模拟方面表现出色。但作为编程助手,该用户更偏好 GPT-5.6-Sol。该对比反映了不同模型在特定任务上的能力差异,GPT-5.6-Sol 在编码任务上获得更高评价。AI模型GPT-5.6-Sol编程助手推理模型推荐理由:看看这位用户实测后说,有一个模型做世界构建和模拟很强,但写代码还是 GPT-5.6-Sol 更靠谱。原文稍后读已读值得跟进有用关注 GPT-5.6-Sol
00:44官方账号Fei-Fei Li@drfeifei精选World Labs创始人Fei-Fei Li在推文中介绍了团队的世界模型分类法,将模拟器定位为智能体行动、学习和评估的关键枢纽。新发布的R2S2R引擎使机器人开发可从缓慢、昂贵、受硬件限制的迭代转向更可扩展、成本更低的训练与评估。该引擎采用真实到模拟到真实(Real-to-Sim-to-Real)循环,有望降低机器人研发门槛。AI模型R2S2RWorld LabsFei-Fei Li2 个信源在谈事件专题推荐理由:Fei-Fei Li团队搞了个R2S2R引擎,让机器人训练不用老在真机上折腾,省时省钱,做机器人开发的一定要看看。原文稍后读已读值得跟进有用关注 R2S2R
00:35官方账号Fei-Fei Li@drfeifeiSceniX加入World Labs时提出空间智能应包含交互。今日World Labs分享早期结果:通过构建虚拟和物理世界来训练机器人。该成果展示了空间智能从感知生成到交互的拓展。具体方法尚未公开,但提供了演示视频。AI模型World Labs空间智能机器人训练1 个信源在谈事件专题推荐理由:李飞飞的World Labs发布了空间智能新进展,用构建的世界训练机器人,把虚拟与现实交互落到了实际应用。原文稍后读已读值得跟进有用关注 World Labs
00:29lmarena.ai@lmarena_ai82°Meta 发布的 Muse Spark 1.1 在 Document Arena 排名第 11(此前第 21),帕累托前沿得分 1472;在 Vision Arena 排名第 14;中文语言类别排名第 3。在 Code Arena: Frontend 排名第 9,帕累托前沿得分 1541,成本为混合每百万 token 输入 1.25 美元、输出 4.25 美元。该模型以低价格实现前沿性能。AI模型Muse SparkMeta成本效率推荐理由:Meta 发了 Muse Spark 1.1,在文档、视觉、代码三大领域成绩都不错,关键价格低,适合预算有限又想用前沿模型的团队。原文稍后读已读值得跟进有用关注 Muse Spark
21:32官方账号阿里通义 Qwen@Alibaba_Qwen阿里巴巴Qwen团队发布Qwen3.8-Max-Preview预览版,并推出#QwenGrowthPlan计划。开发者可使用Qwen3.8完成真实任务,提交成功或失败案例作为反馈。参与者可获得奖励,优秀案例可在X平台@Qwen分享。该计划旨在收集真实用例以优化模型的智能体能力。AI模型Qwen3.8阿里巴巴智能体推荐理由:阿里发了个新模型Qwen3.8-Max-Preview,还搞了个成长计划,让你用模型做任务提反馈还能拿奖励,玩起来!原文稍后读已读值得跟进有用关注 Qwen3.8
20:18官方一手歸藏(guizang.ai)@op7418开源模型Kimi K3(2.8T参数)在80张RTX 5090上以单流20 tok/s运行。该配置使用GDDR7游戏显卡和普通以太网,无需HBM,权重为官方MXFP4格式。此前同一集群运行GLM-5.2时从30 tok/s优化至110 tok/s。任何实验室或大学均可使用该配置复现。AI模型Kimi K3RTX 5090GDDR710 个信源在谈事件专题推荐理由:80张游戏卡就能跑2.8T参数的Kimi K3,20 tok/s挺实用,比之前GLM-5.2快了好几倍。原文稍后读已读值得跟进有用关注 Kimi K3
18:53The Rundown AI@therundownaiMoonshot 公司发布了其 Kimi K3 模型的权重。该模型在多项任务上表现出色。开发者可通过公开渠道下载权重,用于微调或部署。此次开源为社区提供了更强大的基础模型选择。AI模型Kimi K3Moonshot开源模型10 个信源在谈事件专题推荐理由:Moonshot 开放了 Kimi K3 权重,你可以直接下载这个强力模型,比之前很多开源模型更强。原文稍后读已读值得跟进有用关注 Kimi K3
16:26AI Will@FinanceYF5Claude Opus 5(Max 推理版)在 Frontend Code Arena 和 Text Arena 两个基准测试中均取得第一,超越此前领先的 Kimi K3。其默认 high 推理版本表现也不错,在 Code Arena 排名第三(仅次于 Kimi K3),在 Text Arena 排名第二。这一成绩显示 Claude 系列在编码和文本推理任务上的最新进展。AI模型Claude Opus 5Kimi K3Frontend Code Arena10 个信源在谈事件专题推荐理由:Anthropic 的 Claude Opus 5 刚发布就刷榜,在编码和文本两个任务上超过了之前很火的 Kimi K3,值得关注。原文稍后读已读值得跟进有用关注 Claude Opus 5
16:25AI Will@FinanceYF582°Anthropic发布了新模型Claude Opus 5。其推理能力接近Fable 5,定价仅为后者的一半。该模型被描述为深思熟虑且主动。发布后获得267次浏览和1条评论。AI模型Claude Opus 5AnthropicFable 510 个信源在谈事件专题推荐理由:Anthropic新出的Claude Opus 5,智能逼近Fable 5但价格砍半,想升级推理能力又不想花大钱的可以看看。原文稍后读已读值得跟进有用关注 Claude Opus 5
16:23AI Will@FinanceYF5Arena AI 数据显示,Anthropic 的 Claude Opus 5 在启用 Max reasoning 时,在 Frontend Code Arena 中排名第 1,在 Text Arena(factuality on)中也排第 1。Opus 5 默认高推理模式在 Frontend Code Arena 中排第 3(仅次于 Kimi K3),在 Text Arena 中排第 2。这些结果覆盖 agentic 网页编程、文档推理和通用对话能力。其中 Opus 5 Max 的分数为初步数据,最终排名可能变化。AI模型Claude Opus 5Anthropic编程助手10 个信源在谈事件专题推荐理由:Anthropic 的 Claude Opus 5 在真实编程和文本推理任务上跑赢了多数竞品,想看看新模型实力的可以关注这个榜单。原文稍后读已读值得跟进有用关注 Claude Opus 5
16:15Amjad Masad@amasadShouqiao Wang使用OpenAI的GPT-5.6模型,在5天内解决了6个未解决的Erdős问题。该工作不要求深厚的数学知识,而是借助Codex工作流和特定提示词。成果展示了AI模型在算法和数学探索领域的潜力。AI模型GPT-5.6OpenAIErdős问题10 个信源在谈事件专题推荐理由:有人用GPT-5.6在5天解了6个数学界的悬案,而且不用高深数学背景,全靠提示工程。原文稍后读已读值得跟进有用关注 GPT-5.6
13:38小互@imxiaohu精选Kimi K3 是一个拥有2.8万亿参数的混合专家(MoE)模型,包含896个专家,每次推理激活16个。通过三处架构改动,其训练算力效率提升至原来的2.5倍。训练过程使用了5122万个沙箱资源。AI模型Kimi K3MoE推理模型10 个信源在谈事件专题推荐理由:Kimi 新模型K3 参数2.8万亿,896个专家,算力效率拉高2.5倍,技术细节很扎实。原文稍后读已读值得跟进有用关注 Kimi K3
12:59官方账号Greg Brockman@gdb精选David Turturean 主要依靠语音指令,借助AI解决了EpochAI Research的FrontierMath开放问题之一,即找出2-adic绝对伽罗瓦群的显式表示。该问题已公开超过40年,现在他与问题提出者David Roe合作完成了完整证明。AI模型EpochAIFrontierMathAI辅助数学研究推荐理由:有个哥们用AI加上语音指令,把40年没解开的数学难题给破了,还和出题人联名发了证明,真的牛。原文稍后读已读值得跟进有用关注 EpochAI
12:14官方一手歸藏(guizang.ai)@op7418归藏推文称 Codex 今天可能会重置。目前尚无具体版本号或新功能细节。用户需留意后续官方更新或重置后的参数变化。该重置可能影响基于 Codex 的编程工作流。AI模型CodexOpenAI代码生成10 个信源在谈事件专题推荐理由:归藏说 Codex 要重置了,如果你在用 Codex 写代码,建议留意一下今天的变动。原文稍后读已读值得跟进有用关注 Codex
11:30官方一手歸藏(guizang.ai)@op7418Kimi K3已如期开源,并在多家推理服务上线。各平台的API价格保持一致,但部分Token plan已开始打折,例如OpenCode Zen和Cline Pass。Cursor提供的额度也较高。用户预计明天即可在各大平台的Token Plan中使用Kimi K3。AI模型Kimi K3开源模型推理服务10 个信源在谈事件专题推荐理由:Kimi K3开源了,各平台价格统一,但有些套餐已经开始打折,Cursor给的额度也高,想用便宜算力的可以留意了。原文稍后读已读值得跟进有用关注 Kimi K3
11:03Augment Code@augmentcodeAugment 宣布将 Kimi K3 模型引入其产品家族,称其为至今测试过的最强大的开源模型。用户即日起可在 Augment 的智能体编排平台 Cosmos 上使用该模型。推理服务由 Fireworks AI 提供美国境内部署。Kimi K3 由 Moonshot AI 团队开发。AI模型Kimi K3AugmentCosmos10 个信源在谈事件专题推荐理由:想用最强开源模型?Kimi K3 现在在 Augment 的 Cosmos 里就能直接跑,智能体编排加顶级推理,试起来。原文稍后读已读值得跟进有用关注 Kimi K3
10:29Jerry Liu@jerryjliu0Ramp Labs 开源了 PorTAL 框架,用于共享任务表示和跨模型 LoRA 适配。该框架目前支持 Gemma 4 E2B、Mistral 7B 和 Thinky Machines 的 Inkling 模型,覆盖混合注意力模型和多模态系统。代码已在 ramp-public/portallib 仓库中公开,模型托管于 Hugging Face 的 RampPublic 组织。AI模型PorTALRamp LabsLoRA1 个信源在谈事件专题推荐理由:如果你做 LoRA 微调或想用一个框架搞定 Gemma、Mistral 和 Inkling 多个模型的适配,可以看看 Ramp 开源的 PorTAL。原文稍后读已读值得跟进有用关注 PorTAL
08:17Fireworks AI@FireworksAI_HQKimi 发布新模型 Kimi K3,已集成至编程助手 Cursor。该模型在 CursorBench 基准上得分接近前沿水平。推理服务由 Fireworks、Together 和 Baseten 在美国提供,并支持零数据保留。AI模型Kimi K3CursorFireworks10 个信源在谈事件专题推荐理由:Kimi 的 K3 模型现在可以直接在 Cursor 里用了,编程体验接近前沿,而且支持零数据保留,适合敏感场景。原文稍后读已读值得跟进有用关注 Kimi K3
06:37官方账号NVIDIA AI@NVIDIAAI78°NVIDIA Cosmos模型在Hugging Face平台下载量突破1000万次,且仍在增长。该模型是开源世界基础模型,用于构建机器人和自动驾驶等物理AI系统。开发者和研究人员通过下载和实验来推动物理AI应用的发展。AI模型NVIDIACosmosHugging Face10 个信源在谈事件专题推荐理由:NVIDIA的Cosmos模型在Hugging Face上下载量破千万了,专为机器人和自动驾驶设计的开源模型,开发者都在用。原文稍后读已读值得跟进有用关注 NVIDIA
06:36官方账号Cursor@cursor_aiKimi K3 模型正式集成到 Cursor 中。该模型在 CursorBench 基准上得分接近前沿水平。通过 Fireworks、Together 和 Baseten 提供美国地区推理,并支持零数据保留。Kimi K3 在编码辅助方面表现出色。AI模型Kimi K3CursorCursorBench10 个信源在谈事件专题推荐理由:Cursor 上了 Kimi K3,编程能力不输前沿模型,还支持零数据保留,可以试下。原文稍后读已读值得跟进有用关注 Kimi K3
06:27Guillermo Rauch@rauchgGrok 4.5在Vercel的DeepsecBench网络安全漏洞检测基准中取得最佳性价比。其成本仅为Sol的1/10、Opus 5的1/5.7、Kimi K3的1/2.2,但性能与Kimi K3相近。Sol仍保持最高准确率分数,领先Opus 5。Kimi K3以1/5成本获得Sol一半的分数。AI模型Grok 4.5SolDeepsecBench推荐理由:Grok 4.5做安全漏洞检测,比Sol便宜10倍但性能接近Kimi,预算有限的团队可以考虑它。原文稍后读已读值得跟进有用关注 Grok 4.5
06:11lmarena.ai@lmarena_ai精选GPT-5.6 的 Sol、Terra、Luna 三个变体在 Agent Arena 中以 xHigh 设置进行测试。Sol 以 +10.1% 的净改进位列排行榜第二。Terra (+4.0%) 和 Luna (+3.3%) 也取得正向提升,与 Claude Opus 4.8 (+3.5%) 的水平相当。AI模型GPT-5.6Agent ArenaSol推荐理由:GPT-5.6 的 Sol 版在 Agent Arena 上表现亮眼,比 Terra 和 Luna 都强,直接对标 Claude Opus 4.8。想了解新模型实力的话可以看看。原文稍后读已读值得跟进有用关注 GPT-5.6
06:07Poe@poe_platform79°Anthropic 发布最新模型 Claude Opus 5,号称最强大的 Opus 系列模型。其智能水平接近 Claude Fable 5,但价格仅为后者一半。在 agentic coding、知识工作、视觉理解和长时间任务等方面有显著提升。该模型已上线 Poe 平台供用户试用。AI模型Claude Opus 5AnthropicPoe10 个信源在谈事件专题推荐理由:Anthropic 出了 Opus 5,接近 Fable 5 的能力但便宜一半,agent 编程和知识工作更强,快去 Poe 试试。原文稍后读已读值得跟进有用关注 Claude Opus 5
06:06lmarena.ai@lmarena_ai精选GPT-5.6 Terra和Luna(xHigh变体)加入Agent Arena,基于全球社区的真实智能体会话排名第15和第17。在推理努力从低到高时所有变体均有提升,但低推理时Terra持平,Luna下降5.1%。效率前沿显示Luna xHigh(+3.3%)略优于Terra Medium(+3.1%)和Low(+1.2%),更便宜的模型通过更多推理努力可超越昂贵模型。同时GPT-5.6 Sol排名第2,基于7.8K会话,对比GPT-5.5 xHigh净提升1.6%,差距缩小,与Claude Fable 5的“表扬vs抱怨”信号得分分别为+10.9%和+17.3%。AI模型GPT-5.6OpenAIAgent Arena10 个信源在谈事件专题推荐理由:OpenAI的GPT-5.6新变体在真实任务基准中表现具体,小模型靠更多推理能超越大模型,值得关注沙箱数据。原文稍后读已读值得跟进有用关注 GPT-5.6
05:21lmarena.ai@lmarena_ai精选LMSys Chatbot Arena 引入新排名“Factuality”,结合人类偏好与事实准确性。Claude Opus 5 with Max reasoning 在 Text Arena 中位居第一。该排名通过抽取响应、提取可验证声明并逐对检查正确性来审计对战。Factuality 现已作为非默认切换选项在 Text 和 Search Arena 中上线。AI模型Claude Opus 5LMSys Chatbot ArenaFactuality推荐理由:如果你看重模型回答的准确性,LMSys 新出的事实性排名很有参考价值。Claude Opus 5 这次在最重视事实的榜单上拿了第一,比之前只看人类偏好的排名更实在。原文稍后读已读值得跟进有用关注 Claude Opus 5
05:17lmarena.ai@lmarena_ai79°Claude Opus 5 在 LMSYS Arena 的 Frontend Code Arena 中排名第一,Text Arena(factuality 开启)也位列第一。开启默认高推理模式时,它在 Frontend Code Arena 排第三,仅次于 Kimi K3,在 Text Arena 排第二。该数据基于真实世界任务,包括智能体网页编码、文档推理和通用对话。Anthropic 发布的新模型在价格减半的情况下接近 Fable 5 的前沿智能水平。当前 Claude Opus 5 Max 的评分仍为初步结果,后续会更新。AI模型Claude Opus 5AnthropicLMSYS Arena10 个信源在谈事件专题推荐理由:Anthropic 的 Claude Opus 5 在多个 Arena 基准上拿了第一,价格还比 Fable 5 便宜一半。做前端编码或文档推理的朋友可以重点关注。原文稍后读已读值得跟进有用关注 Claude Opus 5
02:56Aadit Sheth@aaditshKimi K3拥有3万亿参数,支持1M上下文和原生视觉,推理能力与顶级闭源模型Opus相当。该模型已在Fireworks平台提供推理和训练服务,由美国托管且零数据留存。其价格比Opus低2-5倍,适合在成本和性能间平衡的场景。这是首个达到3万亿参数级别的开源前沿模型。AI模型Kimi K3Fireworks开源模型10 个信源在谈事件专题推荐理由:Kimi K3在Fireworks上刚上线,3万亿参数、1M上下文、原生视觉,性能不输Opus但便宜好几倍,做高性价比推理就选它。原文稍后读已读值得跟进有用关注 Kimi K3
02:54lmarena.ai@lmarena_aiKimi K3 (Max) 在 Agent Arena 中以 +9.75% 的净提升率超越 GLM-5.2 (Max) 的 +7.12%,成为开源权重模型第一名,并在 Frontend Code 竞技场(1682 分)和 Text 竞技场(1485 分)同样拔得头筹。该模型为 2.8T MoE 架构,支持原生视觉理解与 1M 上下文窗口,号称每单位计算智能提升 2.5 倍。Kimi 团队同步开源模型权重、高性能注意力核、MoE 通信库及代理运行基础设施。AI模型Kimi K3GLM-5.2Moonshot10 个信源在谈事件专题推荐理由:Kimi 开源了 K3 模型,Agent Arena 直接干翻 GLM-5.2,净提升超 9%,代码和文本竞技场也是第一,值得关注。原文稍后读已读值得跟进有用关注 Kimi K3
02:52lmarena.ai@lmarena_aiAgent Arena 推出智能体性能排行榜,使用因果追踪技术分析模型决策路径。排行榜在 arena.ai 页面公开,提供详细方法论说明。该榜单旨在提升智能体评测的透明度和可解释性。AI模型Agent Arena因果追踪智能体推荐理由:想知道AI智能体谁最强?Agent Arena 新出了排行榜,还教你怎么用因果追踪看模型决策,挺有意思。原文稍后读已读值得跟进有用关注 Agent Arena
02:51lmarena.ai@lmarena_aiArena.ai 发布最新榜单,Kimi K3 (Max) 在 Frontend Code Arena 中以 1682 分排名开放权重第一,同时超越所有闭源模型成为整体第一。它在 Agent Arena 中取得 +9.75% 的净提升,领先 GLM-5.2 (Max) 的 +7.12%,并夺得开放权重组冠军。该模型在 7 个领域中的 5 个获得整体第一,仅在游戏和内容创作工具领域排名第二。Agent Arena 通过数百万真实长程智能体任务评估模型,涉及网页搜索、文件系统和终端工具。AI模型Kimi K3Frontend Code ArenaAgent Arena10 个信源在谈事件专题推荐理由:Kimi K3 (Max) 在代码和智能体测试中双料夺冠,连 GLM-5.2 都比它低一截,开发者和研究者可以关注这个新标杆。原文稍后读已读值得跟进有用关注 Kimi K3