04:51Gary Marcus@GaryMarcusRamp AI Index最新数据显示,OpenAI模型Fable 5在企业中的采用表现令人失望。多家企业反馈,该模型定价过高,即便性能强大且曾被短暂封禁,仍被普遍认为不值这个价。这一结果为Anthropic带来了希望,市场人士认为OpenAI可能因此陷入内部混乱。行业OpenAIAnthropicFable 510 个信源在谈事件专题推荐理由:Fable 5贵到企业不买账,OpenAI悬了,Anthropic的机会来了。原文稍后读已读值得跟进有用关注 OpenAI
04:41GitHub@github76°Gemini 3.7 Flash 现已在 GitHub Copilot 中全面可用,覆盖 Copilot 应用、CLI 和 VS Code。早期测试显示它在 Web 和 App 开发及智能体编码工作流上有所提升。它还改进了代码质量、最终输出呈现、代码库研究和复杂任务验证。开发者可直接在 GitHub Copilot 中试用。AI模型Gemini 3.7 FlashGitHub CopilotGoogleAI推荐理由:Google 的 Gemini 3.7 Flash 上线 GitHub Copilot 了,写代码和智能体任务都有改善,在 Copilot 里就能直接用。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
04:23Fireworks AI@FireworksAI_HQ精选Arcee AI 宣布开源 nac,这是一个用于长时间运行任务的 agent harness,现已以 Apache 2.0 协议发布在 GitHub 上。同时,Arcee 推出开放模型 API 的 beta 版本。Fireworks AI 参与合作,在 Arcee 平台上提供 Kimi-K3 模型供用户试用。nac 专为开发者处理复杂多步骤的工程工作负载而设计。AI产品Arcee AInacFireworks AI2 个信源在谈事件专题推荐理由:Arcee 开源了 agent 工具 nac,能跑长时间任务,还出了 API 测试版,Fireworks 上也就能用 Kimi-K3 了。原文稍后读已读值得跟进有用关注 Arcee AI
04:11Lenny Rachitsky@lennysanMatic 通过 OTA 更新推出 Cues 功能,支持语音和手势控制。用户说“Hey Matic”即可定位声音,指向污渍并说“clean this”会自动清洁。该机器人理解 75 种语言,具备 8 倍气流和针对地毯、角落的清洁算法。官方称已获 WIRED 10/10 评分,被 13,000 个家庭使用。AI产品Matic语音控制手势控制推荐理由:Matic 机器人 OTA 升级后能听懂语音指令、看懂手势,指哪扫哪,支持75种语言,比普通扫地机器人聪明多了。原文稍后读已读值得跟进有用关注 Matic
04:02Philipp Schmid@_philschmid78°谷歌发布Gemini 3.7 Flash,在Zapier的AutomationBench基准上拿下30%得分,成为首个突破30%的模型。三周前Gemini 3.6 Flash得分19.8%,这次每任务成本仅增加3美分。在营销、财务、销售、支持四个领域表现领先,其中营销38%、财务37.5%。但在运营领域仍落后,Opus 5以50%保持领先。AI模型Gemini 3.7 FlashAutomationBenchZapier推荐理由:谷歌突袭发布Gemini 3.7 Flash,AutomationBench拿到30%,比贵一倍的模型还强。做智能体自动化任务可以试试。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
03:55Aravind Srinivas@AravSrinivas75°xAI发布的新模型Grok 4.6现已集成到Perplexity和Perplexity Computer,面向Pro和Max用户开放。Perplexity在WANDR基准上使用Perplexity Computer harness测试其作为协调器的表现,结果显示Grok 4.6位于性能与成本的帕累托前沿。在WANDR上,Grok 4.6匹配Fable 5的结果,但成本降低超过60%。AI模型Grok 4.6PerplexityxAI推荐理由:Perplexity官推宣布Grok 4.6上线,当协调器用,效果追平Fable 5,成本却低六成,Pro和Max用户直接能用。原文稍后读已读值得跟进有用关注 Grok 4.6
03:53Aravind Srinivas@AravSrinivas83°谷歌在3.6 Flash发布三周后推出Gemini 3.7 Flash。新版本在编码和智能体任务上进步明显,软件工程、知识工作与网页开发均有提升。其首发价格为3.6 Flash原价的一半。模型现已通过Gemini API、Google AI Studio与Antigravity开放使用。AI模型Gemini 3.7 Flash谷歌智能体推荐理由:谷歌新出的3.7 Flash只要3.6一半价格,编码和智能体更强,适合做子智能体跑任务。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
03:50Gary Marcus@GaryMarcus72°过去12个月,OpenAI至少有16位高管离职,包括首席运营官、AGI部署CEO、首席未来学家、Sora负责人、安全系统负责人等。离职名单覆盖运营、研究、产品、硬件、安全等多个关键岗位。Gary Marcus在转发中评论称,这种人员流失速度并不正常。行业OpenAI高管离职人事变动7 个信源在谈事件专题推荐理由:OpenAI又走了一批核心高管,12个月内16人,从COO到Sora负责人都没留住。Gary Marcus转评说这不正常,值得看看。原文稍后读已读值得跟进有用关注 OpenAI
03:48宝玉@dotey精选推文认为软件自进化是伪命题,插件要么一次性、要么需要设计验证维护,OpenClaw的Skills已是反例。另一段长文分析DeepSeek Harness(DSH):官方提供Web和headless两种运行形式,核心是“一切皆插件”。DSH目前可让Agent检查自身runtime、现场写插件挂载,但动态插件仅存内存,重启即消失。作者判断DSH有自进化雏形,但插件生态仍处早期,质量参差。AI产品DeepSeek HarnessOpenClaw智能体10 个信源在谈事件专题推荐理由:DeepSeek的Harness框架让Agent能自己写插件扩展能力,比Claude Code更可DIY,虽然还很早期。原文稍后读已读值得跟进有用关注 DeepSeek Harness
03:46宝玉@dotey精选马天翼在社交平台发文称,DeepSeek作为模型厂商,做Agent Harness产品比做SDK更有价值,因为SDK难以获取用户行为数据。他认为Agent Harness产品应优先追求用户体验,其次才是插件可定制化。他类比称,Claude Code和Codex像苹果追求极致体验,而DeepSeek Harness可能走安卓式开源路线,由社区DIY、企业私有化魔改。插件生态是这套模式最核心的环节。行业DeepSeekAgent HarnessClaude Code推荐理由:有人拿DeepSeek和Claude Code对比,说前者该学安卓走开源路线,插件生态才是核心。原文稍后读已读值得跟进有用关注 DeepSeek
03:45Guillermo Rauch@rauchgVercel 旗下 eve.dev 通过 AI Gateway 为 eve agents 免费提供 GLM 5.2 模型,该模型由 blackboxai 提供。免费期持续到 8 月 27 日,最高吞吐量达 500TPS。用户只需在 agent.ts 中设置“zai/glm-5.2”即可调用,新创建的 eve agents 默认使用该模型。这降低了智能体开发的模型调用成本。AI产品GLM 5.2eve.devVercel推荐理由:做 AI 代理开发的可以白嫖 GLM 5.2 了,eve.dev 直接免费跑,速度还快,赶紧试试。原文稍后读已读值得跟进有用关注 GLM 5.2
03:43Gary Marcus@GaryMarcusJürgen Schmidhuber 在推特上引述历史,指出首个现代反向传播训练 CNN 用于视觉的论文由 Wei Zhang、J. Tanida 等人于 1988 年在日本发表。Wei Zhang 后来将技术带到硅谷,1998 年获得 FDA PMA 批准,成为放射学领域的第一个 AI。该系统在美国每年读取超过 1000 万张乳腺 X 光片。论文Jürgen SchmidhuberWei ZhangCNN推荐理由:原来首个反向传播 CNN 是 1988 年 Wei Zhang 等人做的,后来拿到 FDA 批准,成了美国读乳腺 X 光片的头号 AI。原文稍后读已读值得跟进有用关注 Jürgen Schmidhuber
03:41Varun Mohan@_mohansolo71°Google Antigravity 正式上线 Gemini 3.7 Flash。这是谷歌面向编程和智能体场景的最新主力模型,API 成本降至原先一半。官方称其为 Antigravity 迄今最智能的实用型模型。用户升级或下载 Antigravity 应用即可使用。AI模型Gemini 3.7 FlashGoogle Antigravity编程助手推荐理由:谷歌的Gemini3.7Flash上了Antigravity,编程和智能体更强,API便宜一半,试下。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
03:39Paul Couvert@itsPaulAi83°谷歌发布Gemini 3.7 Flash,被评价为该智能水平上最高效的模型之一。它的性能优于Sonnet 5、GPT-5.6 Terra和Muse Spark 1.2。价格仅为Gemini 3.6 Flash的一半,优惠至少持续到年底。目前已在AI Studio和Antigravity平台上线。只有GPT-5.6 Luna Max在效率上更胜一筹,但它不擅长前端任务。AI模型Gemini 3.7 FlashGoogleSonnet 5推荐理由:谷歌新发的Gemini 3.7 Flash,效率比Sonnet 5高,价格只有3.6 Flash一半,现在AI Studio就能玩。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
03:28官方账号Simon Willison@simonw精选Google DeepMind 发布 Gemini 3.7 Flash,官方称其在调试、问题解决等编码任务上较 3.6 Flash 有明显提升。该模型能用更少提示词设计更实用的网页布局和应用,并在真实业务工作流中提供更好的推理和准确性。API 已上线 Google AI Studio 和 Android Studio,Pro/Ultra 用户可在 Gemini App 中使用。不过 3.7 Flash 的“入门定价”计划于 2026 年 12 月 31 日翻倍,发布者认为五个月后该模型可能已过时。AI模型Gemini 3.7 FlashGoogle DeepMind3.6 Flash推荐理由:3.7 Flash 刚出,定价却预告明年翻倍,有点怪。想试试新模型的可以看看它比 3.6 强在哪。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
03:27Fireworks AI@FireworksAI_HQMicrosoft Teams Calls for Startups发布了一份指南,介绍初创企业如何在Microsoft Foundry上部署Fireworks模型。指南涵盖成本、延迟、灵活性和未来模型选择等关键因素。通过FireworksAI与Microsoft Foundry的集成,初创企业可在Azure中运行开源模型,并支持监控、缓存、治理和模型实验等功能。该架构旨在帮助初创企业从MVP阶段平滑扩展到生产环境。技巧FireworksMicrosoft FoundryAzure推荐理由:微软和Fireworks出了个实战指南,教你用Azure Foundry跑开源模型,从原型到生产该注意啥都讲清楚了,做AI产品的不妨看看。原文稍后读已读值得跟进有用关注 Fireworks
03:23官方账号xAI@xai精选76°Grok 4.6 已上线 Pi 平台。该版本面向长时间运行的智能体任务,编码、知识工作和视觉能力有所提升。定价为输入每百万 tokens 2 美元,输出每百万 tokens 6 美元。用户刷新模型目录即可选用。AI模型Grok 4.6PixAI推荐理由:Pi 上现在能直接用 Grok 4.6,跑长任务智能体更稳,编码和视觉也比之前强,价格也公布了。原文稍后读已读值得跟进有用关注 Grok 4.6
03:11a16z@a16zJoe Schmidt在a16z的活动中表示,企业AI公司不必都在旧金山打广告。他指出,旧金山湾区常有两家直接竞争的软件公司隔着高速公路销售同一类产品,且瞄准相同的客户群。他建议创始人可以考虑俄亥俄、芝加哥、圣路易斯等地区,寻找真正需要解决方案的买家。他还提出了一套评估框架,帮助创始人决定该采用哪种销售打法。行业Joe Schmidta16z企业AI推荐理由:Joe Schmidt给AI创业者提了个醒:别都扎堆旧金山跟人挤,俄亥俄、芝加哥有的是客户,去看看呗。原文稍后读已读值得跟进有用关注 Joe Schmidt
03:06Harrison Chase@hwchase17LangChain作者Harrison Chase提出一个省token的技巧:在调用昂贵Agent前,先让轻量分类器判断输入是否值得运行。只有分类器判定满足条件时,才启动完整Agent流程。这能避免把简单任务也丢给重型模型,烧掉大量token。该建议是对SrinathJ“不是人人都能烧万亿token”的回应。技巧智能体轻量分类器成本优化推荐理由:LangChain作者分享:跑贵Agent前先用便宜分类器筛一道,省token,简单任务不用烧钱。原文稍后读已读值得跟进有用关注 智能体
03:05Harrison Chase@hwchase17精选LangChain 联创 Harrison Chase 在 X 上表示,agent 在后台持续运行才是未来,规模化路径是让它们自行触发,而非等待人类逐条提示。团队为 Managed Deep Agents 加入了定时调度(schedule)能力,基于 cron 机制,开发者用几行代码即可让 agent 按设定日程自主启动。代码示例来自新版 MDA 文档。这一功能让 Managed Deep Agents 可从同步交互转为无人值守的定时自动化。AI产品Managed Deep AgentsLangChain智能体推荐理由:LangChain 的 Harrison Chase 说,以后 agent 要在后台自己跑,用 Managed Deep Agents 几行代码就能设置定时触发,不用人盯着了。原文稍后读已读值得跟进有用关注 Managed Deep Agents
03:02lmarena.ai@lmarena_ai精选Gemini 3.7 Flash (High) 在 Text Arena 中以1490分排名第9,较前代 Gemini 3.6 Flash (High) 的第16位明显提升。分项中创意写作从第12升至第3,数学从第7升至第4,指令跟随从第17升至第9,多轮对话从第21升至第10。其得分与 Qwen-3.8 (Max) 的1491分、Claude Opus 5 (Max) 的1493分几乎持平。AI模型Gemini 3.7 FlashText ArenaQwen-3.8推荐理由:Gemini 3.7 Flash在Text Arena冲到第9,创意写作第3,数学第4,跟Qwen-3.8和Claude Opus 5只差几分。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
03:01AI SDK@aisdkVercel 在官方推文中宣布 AI SDK 新增 Google AI 提供商。开发者可通过 ai-sdk.dev/providers/ai-s… 查看接入指南。该更新让 AI SDK 开发者能够直接调用 Google AI 模型。AI产品VercelAI SDKGoogle AI推荐理由:Vercel的AI SDK现在支持Google AI了,去ai-sdk.dev看看怎么配置,以后调Google模型更方便。原文稍后读已读值得跟进有用关注 Vercel
03:00Qdrant@qdrant_engine精选拜耳用 Qdrant Hybrid Cloud 搭建了面向 11.6 万名员工的企业搜索引擎,生产环境已运行三年。该引擎在 4 个节点上管理 3500 万向量数据点,支持混合搜索以服务深度智能体。团队引入语义缓存来控制智能体调用成本,并测出 20% 的效率提升。案例详细介绍了从原型到平台的落地路径。技巧BayerQdrant企业搜索推荐理由:拜耳这套企业搜索跑在 Qdrant 上,4 节点管 3500 万向量,语义缓存控成本,还提升了 20% 效率。原文稍后读已读值得跟进有用关注 Bayer
02:58Harrison Chase@hwchase17精选LangChain 在 docs.langchain.com 更新了 managed deepagents 的官方文档。新文档将每个 agent 组件都定义为独立文件。开发者通过点击即可查看组件在仓库中的位置和具体代码。这样配置生产环境中的 agent 结构变得更加直观。AI产品LangChainDeepAgents智能体推荐理由:搞生产级 agent 的可以看看,LangChain 把 managed deepagents 的文档重写了,每个组件一个文件,点开就能看到代码在哪,省事。原文稍后读已读值得跟进有用关注 LangChain
02:57官方账号Perplexity@perplexity_aiGrok 4.6 已在 Perplexity 和 Perplexity Computer 上线。该模型在 WANDR 基准上位于性能和效率的帕累托前沿。相比 Fable 5,Grok 4.6 在结果持平的情况下成本降低超过 60%。用户现在即可在 Perplexity 生态中直接使用 Grok 4.6。AI模型Grok 4.6PerplexityWANDR6 个信源在谈事件专题推荐理由:Grok 4.6 上线 Perplexity 了,在 WANDR 上跟 Fable 5 结果持平,成本还低 60% 以上。原文稍后读已读值得跟进有用关注 Grok 4.6
02:55官方账号NVIDIA AI@NVIDIAAIMeta 官方账号 AIatMeta 发布了一则 AI 平台演示。演示配套的 Platform cookbook 与 Demo/recipe 两个仓库都已公开在 GitHub 上。开发者可以按 Platform cookbook 中的步骤在本地复现并尝试。技巧MetaGitHub教程推荐理由:Meta 出了演示和 Cookbook,直接照着 GitHub 仓库能自己跑,想上手试试的可以看。原文稍后读已读值得跟进有用关注 Meta
02:53ollama@ollamaMeta 的 Muse Glimmer 模型可通过 Ollama 在本地运行。该流程用于处理个人月度信用卡账单,数据完全保留在本地。用户可借助 Ollama 搭配常用应用或 harnesses 执行不同的智能体任务。此推文展示了这一用例,强调数据归属用户。技巧Muse GlimmerOllamaMeta推荐理由:Ollama 演示了用 Muse Glimmer 本地跑信用卡账单分析,数据不出本机,想玩本地智能体任务可以照着试。原文稍后读已读值得跟进有用关注 Muse Glimmer
02:51elvis@omarsar0精选Harness-IF提出一种规则评估方法,通过从执行证据中逐条打分256条规则,并在九个探针构建中撤回每条规则后重跑任务,来区分规则是否真正改变了模型行为。在12个前沿模型上,原始准确率为72.1%到85.9%,剔除巧合后的Against-Prior准确率降至66.1%到78.6%,每个模型下降3.6到7.4个点。研究发现优先级不随提示词深度变化,系统提示、项目文件和用户指令的优先级都高于工具和技能描述。论文见arxiv.org/abs/2608.11727。论文AGENTS.mdHarness-IF智能体推荐理由:如果你在给编码智能体写AGENTS.md,这篇论文用256条规则和12个模型实测告诉你哪些规则真有用,别凭感觉写了。原文稍后读已读值得跟进有用关注 AGENTS.md
02:47lmarena.ai@lmarena_ai精选Agent Arena完整排行榜详情已在官网公开,页面地址为arena.ai/leaderboard。官方通过X平台账号发布了链接,该推文目前已有1233次浏览,并附带1张数据图表。用户可前往页面查看各智能体的具体排名与表现。AI模型Agent Arena智能体评测基准推荐理由:想看AI智能体谁强谁弱?Agent Arena完整榜单出来了,去arena.ai/leaderboard就能看。原文稍后读已读值得跟进有用关注 Agent Arena
02:46lmarena.ai@lmarena_ai精选arena.ai更新了Code Arena: WebDev和Text Arena的帕累托前沿图。帕累托前沿展示了不同模型在多维性能上的最优组合。用户可据此快速比较模型,并跳转到对应排行榜查看详细数据。AI模型Code ArenaText Arena帕累托前沿推荐理由:想去arena.ai找代码或文本任务的最强模型?看这个帕累托前沿图,一眼就能知道哪些模型在权衡点上更值。原文稍后读已读值得跟进有用关注 Code Arena
02:45lmarena.ai@lmarena_aiLMArena 官方发布了 Code Arena 的 WebDev 子榜与 Text Arena 的完整排行榜。两份榜单均托管在 arena.ai 的 leaderboard 页面下。该榜单基于用户对战投票,反映模型在网页开发与文本任务上的能力对比。具体模型排名可在对应页面查看。AI产品LMArenaCode ArenaText Arena推荐理由:LMArena 把 Code Arena(WebDev)和 Text Arena 的完整榜单放出来了,想看模型在网页开发和文本任务上的排名,直接点链接查。原文稍后读已读值得跟进有用关注 LMArena
02:43宝玉@doteyDeepSeek Harness团队表示,招聘重点不是天才程序员或奥赛金牌得主。DeepSeek更需要真正懂AI产品的产品经理。DeepSeek现阶段最重要的任务是把产品定义清楚、规划清楚。行业DeepSeekHarnessAI产品经理推荐理由:DeepSeek Harness团队公开说招产品经理优先,不看重竞赛金牌。想投AI产品岗的可以看看他们的定位。原文稍后读已读值得跟进有用关注 DeepSeek
02:42宝玉@dotey独立开发者@dotey 以普通用户视角试用 DeepSeek Harness,指出启动需 Node.js 环境,对非程序员不友好。他称赞运行速度飞快,但 Thinking 部分文字因 Flash 模型过快而闪烁,建议做节流处理。他还建议借鉴 Codex 的多 Tab 面板,并希望模型尽早支持多模态。实测中 DSH 生成的 PPT 质量不错。AI产品DeepSeek HarnessDeepSeek智能体10 个信源在谈事件专题推荐理由:程序员用户实测 DeepSeek Harness,速度飞快、PPT 做得不错,但普通用户装 Node.js 会卡住。想入坑前先看他这条反馈。原文稍后读已读值得跟进有用关注 DeepSeek Harness
02:38Google AI Developers@googleaidevs78°谷歌AI开发者宣布推出Gemini 3.7 Flash,称其为用于编码和智能体任务的最智能实干型模型。Gemini 3.7 Flash提升了指令遵循、首次代码准确率和智能体任务执行质量。官方演示中,该模型在Antigravity环境中构建了一个复杂3D网络游戏,包括生成Three.js样板代码、相机移动和碰撞检测。演示还使用Nano Banana创建PBR材质贴图和自定义精灵表,并集成了程序化音频。AI模型Gemini 3.7 FlashGoogle AI智能体推荐理由:谷歌发了Gemini 3.7 Flash,写代码和跑智能体任务更稳了,官方演示用它搭3D游戏,开发者可看看。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
02:37HeyGen@HeyGen_OfficialLiveAvatar 宣布原生集成 Cartesia,已有语音代理无需重建即可获得实时人脸表现。官方提供三种方式将 Cartesia 的声音和代理接入 AI 头像。该功能让原本局限于文本框的对话代理,能够以虚拟面部进行实时交互。AI产品CartesiaLiveAvatar语音代理推荐理由:如果你在用 Cartesia 搭语音代理,现在可以直接在 LiveAvatar 上给它加一张实时人脸,不用改代码。原文稍后读已读值得跟进有用关注 Cartesia
02:31Philipp Schmid@_philschmid精选3.7 Flash在智能体循环中不再过度急切,而是先进行更多探索。3.7 Flash会先解析错误并运行测试,再修改代码。3.7 Flash的首次通过准确率明显更高,浪费的智能体轮次也更少。AI模型3.7 Flash智能体编程推荐理由:3.7 Flash改代码前先摸清环境、跑测试,少走弯路,能省不少无效循环。原文稍后读已读值得跟进有用关注 3.7 Flash
02:30Philipp Schmid@_philschmid82°Google宣布Gemini 3.7 Flash正式可用。该模型在DeepSWE基准上从49.0%升至65.3%,在FrontierCode上得分43.6%,AutomationBench上得分30.4%。它现为Google AI Studio、Antigravity和Gemini App的默认模型。输入输出价格下调50%,分别为每百万token 0.75美元和3.75美元,优惠持续到年底。AI模型Gemini 3.7 FlashGoogle智能体推荐理由:谷歌发布Gemini 3.7 Flash,DeepSWE从49%涨到65%,编码智能体都能打,价格还打五折,直接上手吧。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
02:28AI SDK@aisdkAI SDK 官方推特宣布支持使用 Gemini 3.7 Flash。开发者可以在 AI SDK 中直接调用 Gemini 3.7 Flash。这次更新将 Gemini 3.7 Flash 集成进 AI SDK 工作流。具体操作可参考 AI SDK 官方推特内容。AI产品Gemini 3.7 FlashAI SDK模型调用推荐理由:AI SDK 官方刚宣布支持 Gemini 3.7 Flash,用这个 SDK 的开发者可以直接接上了,去推特点开看看。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
02:24lmarena.ai@lmarena_ai72°Google DeepMind的Gemini 3.7 Flash (High)在Agent Arena取得+3.4%净提升。整体排名第20,高于Gemini 3.6 Flash (High)的第35名。长程智能体任务表现与Claude Sonnet 4.6和GPT-5.6 Terra (xHigh)处于同一区间。其Confirmed Success信号得分提升10%,位列第5。官方称该模型在编码、知识工作和网页开发方面更强。AI模型Gemini 3.7 FlashGoogle DeepMindAgent Arena推荐理由:谷歌新出的Gemini 3.7 Flash在智能体评测里冲到第20,比上代强一截,编码和网页开发更好用了,感兴趣的可以试试。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
02:23lmarena.ai@lmarena_ai81°Google DeepMind 发布 Gemini 3.7 Flash (High),已在 LMArena 的 Code Arena: WebDev 和 Text Arena 上线。该模型在 WebDev 排名从第 19 位升至第 8 位,明显优于上一代 Gemini 3.6 Flash (High)。它在数据与分析类别排名第 7,在模拟、游戏与内容创作工具类别排名第 8,在参考设计类别排名第 9。AI模型Gemini 3.7 FlashGoogle DeepMindLMArena推荐理由:谷歌 DeepMind 的新 Flash 模型在 WebDev 榜冲到第8,比上代进步不小,做网页或数据任务可以试试。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash