04:50elvis@omarsar076°Anthropic在与美国政府对话后,于全球重新部署Claude Fable 5模型,并新增一套分类器以阻止网络安全相关任务。短期内,部分常规任务(如编码和调试)将回退到Opus 4.8处理。Anthropic计划在未来数周内持续优化这些分类器,以减少误判。同时,他们正联合Amazon、Microsoft、Google等伙伴起草AI越狱严重性评估共识框架,并扩大与美国政府的合作,包括预发布模型安全评估和信息共享。AI模型Claude Fable 5AnthropicOpus 4.810 个信源在谈事件专题推荐理由:Anthropic把Claude Fable 5加了安全护栏重新上线,但代价是部分功能降级到Opus 4.8。想了解新模型具体被削了哪些能力、行业如何反应,可以看这篇。原文稍后读已读值得跟进有用关注 Claude Fable 5
04:41OpenRouter@OpenRouterAI精选Anthropic 在 OpenRouter 上重新部署了 Claude Fable 5 模型。新版本增加了针对网络安全滥用的防护措施。在分类器优化期间,部分代码和调试请求可能临时回退到 Opus 4.8。该推文获得了 206 个赞和 9290 次查看。AI模型Claude Fable 5AnthropicOpenRouter10 个信源在谈事件专题推荐理由:想用 Claude 但担心安全?Anthropic 这次加了新防护,编程请求可能暂时降级到 Opus 4.8,你可以在 OpenRouter 上体验。原文稍后读已读值得跟进有用关注 Claude Fable 5
04:23GitHub@github71°Anthropic 的 Claude Fable 5,即 Mythos 模型系列的第一款,已在 GitHub Copilot 中重新启用并正式可用。该模型专为长周期自主编码和知识工作任务设计,支持在 VS Code 或 GitHub Copilot 应用中使用。此举恢复了此前可能暂停的服务,并扩大了用户访问范围。AI模型Claude Fable 5AnthropicGitHub Copilot10 个信源在谈事件专题推荐理由:GitHub 和 Anthropic 让 Claude Fable 5 回归 Copilot,专攻长周期自主编码,写复杂任务更顺手。原文稍后读已读值得跟进有用关注 Claude Fable 5
03:52官方账号NVIDIA AI@NVIDIAAI78°NVIDIA Research将30B参数的Nemotron-3-Nano-30B-A3B模型拆分为两半,一半维护上下文,一半生成token。该扩散语言模型仅复用预训练权重而非从头训练,在保持98.7%原始质量的同时实现了2.42倍的生成加速。这种方法将传统的自回归逐token生成改为并行写入,显著提升了推理效率。AI模型NemotronNVIDIA扩散语言模型7 个信源在谈事件专题推荐理由:NVIDIA把30B模型劈成两半,并行写token,速度翻倍还保质量,不是新训模型是复用预训练,挺聪明的做法。原文稍后读已读值得跟进有用关注 Nemotron
03:48Guillermo Rauch@rauchg精选Vercel CEO 引用 8090.ai 的测试:在将 PHP 应用现代化为 Next.js 的任务中,Opus 4.8 搭配 Software Factory 比单独 Opus 4.8 便宜 1.4 倍、快 1.5 倍;换用 GLM 5.2 成本降低 16.4 倍,但速度慢 3 倍。测试为单样本方向性结果,后续将扩大样本量并对比美国开模型。AI模型GLMOpus 4.8Next.js10 个信源在谈事件专题推荐理由:GLM 搭配 8090 的 Software Factory 在代码迁移任务中成本砍到 1/16,虽然慢了点,但省钱效果很直观。原文稍后读已读值得跟进有用关注 GLM
03:06Cognition@cognition_labsCognition发布了Agentic MapReduce的详细文档和技术材料,包括对评估的深度解析。该文档涵盖安全评估等具体内容。相关博客文章和评估页面已在devin.ai上线。AI模型Agentic MapReduceCognitionDevin推荐理由:Devin团队放出了Agentic MapReduce的完整技术文档和评估,想了解智能体如何结构化处理任务可以看看。原文稍后读已读值得跟进有用关注 Agentic MapReduce
02:28Recraft@recraftaiRecraft AI 今天发布了两款新模型。这两款模型已立即上线 Recraft Studio。用户无需等待列表即可直接使用。AI模型Recraft AIRecraft Studio模型发布推荐理由:Recraft AI 今天直接发布了两款新模型,不用排队就能在 Recraft Studio 里用,快去试试。原文稍后读已读值得跟进有用关注 Recraft AI
01:58@koltregaskes@koltregaskes78°Claude Fable 5 的一个变体或 v2 版本在 LMSys Chatbot Arena(LM Arena)上短暂出现后被撤下,暗示该模型即将重新发布。截至目前,Android 应用尚未发现该变体。这一迹象表明 Anthropic 可能正在准备下一轮公开部署,具体上线时间未知。AI模型Claude Fable 5LM Arena模型评测10 个信源在谈事件专题推荐理由:Claude Fable 5 的新版本在评测榜上闪了一下就没了,可能是马上要发布了,值得蹲一下。原文稍后读已读值得跟进有用关注 Claude Fable 5
00:27AK@_akhaliqLiteResearcher是一个针对深度研究智能体设计的可扩展强化学习训练框架。该框架采用智能体RL方法,支持大规模训练,旨在提升AI在复杂研究任务中的自主探索和推理能力。它通过强化学习优化智能体的研究策略,使模型能够更高效地完成多步推理和信息综合。AI模型LiteResearcher智能体推理模型推荐理由:LiteResearcher是专门为深度研究智能体打造的RL训练框架,能更高效地训练复杂推理能力,适合关注智能体研究和强化学习的朋友。原文稍后读已读值得跟进有用关注 LiteResearcher
00:21berryxia@berryxiaModelScope上开源了Boogu-Image-0.1-Edit-Turbo模型,这是一个4步蒸馏的image-to-image编辑模型,主打快速视觉编辑。它支持物体替换、风格迁移、场景/背景修改以及带文字感知的图像变换。该模型基于蒸馏技术,显著减少了生成步数,提升了编辑速度。AI模型Boogu-Image-0.1-Edit-TurboModelScope图像编辑推荐理由:想快速改图吗?ModelScope刚开源这个4步蒸馏图像编辑模型,换物体、改背景、风格迁移都能做,速度很快。原文稍后读已读值得跟进有用关注 Boogu-Image-0.1-Edit-Turbo
00:09官方账号LMSYS Org (SGLang)@lmsysorg精选73°LMSYS 发文感谢 NVIDIA 在其最新推理软件经济学报告中提及 SGLang。SGLang 推出针对 Blackwell 架构的 day-0 优化方案,将 DeepSeek V4 的推理性能提升最高 5 倍。该优化通过 CUDA 原生推理路径实现,显著降低了每 token 成本。NVIDIA AI 团队与 SGLang 合作的具体技术细节已在博客中公开。AI模型SGLangNVIDIADeepSeek V48 个信源在谈事件专题推荐理由:SGLang 和 NVIDIA 联手让 DeepSeek V4 在 Blackwell 上跑得快了 5 倍,开源推理引擎的效率又上了一个台阶。原文稍后读已读值得跟进有用关注 SGLang
23:38The Rundown AI@therundownaiOdyssey公司融资3.1亿美元,估值14.5亿美元,由Amazon和AMD Ventures领投。其Agora-1模型能实时生成黄金眼游戏的地图、物理和多人对战,全部从数据学习而非编程。该模型让最多4名玩家共享同一AI模拟,且无硬编码规则。公司称世界模型正接近GPT-3时刻的转折点。AI模型OdysseyAgora-1黄金眼推荐理由:Odyssey用世界模型实时生成了黄金眼游戏,不用写一行规则,还能四人联机。这才是AI模拟物理世界的方向。原文稍后读已读值得跟进有用关注 Odyssey
23:29官方账号Jim Fan@jimfan76°Jim Fan团队发布ASPIRE,这是他们物理自研系列的第二项工作。ASPIRE让机器人构建一个自我进化的技能库,解决第100个任务时不再像第一个任务那样茫然。该方法通过编码代理观察模拟和真实机器人的多模态传感轨迹,对控制程序进行进化搜索,并将最佳知识提炼到不断扩展的库中。ASPIRE实现了约10倍的迁移学习token削减,相比传统从头重训练效率大幅提升。项目展示了超过90项技能和150+任务,代码将开源。AI模型ASPIREJim Fan机器人技能库推荐理由:Jim Fan团队搞了个新东西叫ASPIRE,让机器人自己攒技能库,迁移学习快了10倍,还开源了全栈代码。原文稍后读已读值得跟进有用关注 ASPIRE
22:18Aadit Sheth@aaditsh精选73°Anthropic 恢复 Fable 5 访问,同时推出新模型 Sonnet 5,定价每百万 tokens 2 美元。该价格不到 GPT 5.5 的一半。此前 Fable 5 因出口管制被禁 18 天,期间开发者转向其他模型。Anthropic 希望低价新模型能吸引用户回归。AI模型AnthropicFable 5Sonnet 510 个信源在谈事件专题推荐理由:Anthropic 把 Sonnet 5 定价降到 $2/百万 tokens,比 GPT 5.5 便宜一半多,开发者有理由回来了。原文稍后读已读值得跟进有用关注 Anthropic
19:48The Rundown AI@therundownaiAnthropic推出Sonnet 5模型,性能较前代提升约30%,在MMLU和HumanEval基准上分别达到90.2%和85.1%。Google发布Nano Banana Lite和Omni Flash两种新模型,后者支持多模态推理,参数量为7B。Anthropic还设立科学中心Claude Science Hub,用于加速生物医学研究。同时社区推出4款AI新工具和基于Claude的广告生成工作流。AI模型AnthropicSonnet 5Google10 个信源在谈事件专题推荐理由:Anthropic发了Sonnet 5,Google出了Nano Banana Lite和Omni Flash,还有Claude生成广告的教程,干货满满。原文稍后读已读值得跟进有用关注 Anthropic
19:47Geek@geekbb72°Google AI Studio 推出 Gemini Omni Flash,这是一个高质量、低成本的多模态模型,专注于视频生成和对话式编辑。用户可以通过自然语言和简单提示来精炼视频。该模型已在 AI Studio 和 Gemini API 中开放使用。Gemini Omni Flash 支持多模态工作流,旨在降低视频生成的门槛。AI模型Google AI StudioGemini Omni Flash视频生成推荐理由:Google 出了个便宜好用的视频生成模型 Gemini Omni Flash,直接用自然语言改视频,快去 AI Studio 试试。原文稍后读已读值得跟进有用关注 Google AI Studio
16:50orange.ai@oran_geSonnet 5 因更换tokenizer导致实际费用与Opus 4.8相近,在GDPeval等金融基准上表现最佳。编程任务中Sonnet 5费用可能超过Opus 4.8,被用户吐槽。Opus 4.8擅长复杂编程和HTML设计,但写作不如Opus 4.6。GPT 5.5目前是编程首选。四款模型均已上线Cola平台。AI模型Sonnet 5Opus 4.8GPT 5.510 个信源在谈事件专题推荐理由:Sonnet 5 换了tokenizer后费用涨了,金融评测很强但编程费钱,Opus 4.8和GPT 5.5各有特长,选模型前先算账。原文稍后读已读值得跟进有用关注 Sonnet 5
16:48小互@imxiaohu用户用Best.XiaoHu.AI内容测试了Sonnet 5、4.6和Opus。Sonnet 5在文字和翻译任务上比4.6有明显提升,但前端设计、交互和SVG能力远不如Opus。用Sonnet 5替代文字翻译可节省约一半输入token,速度提升1倍多。翻译成本量级下降约80%,质量零损失。AI模型Sonnet 5Sonnet 4.6Claude Opus4 个信源在谈事件专题推荐理由:网友实测Sonnet 5翻译超省:成本降80%、速度翻倍,但前端别指望它。原文稍后读已读值得跟进有用关注 Sonnet 5
15:52AI Will@FinanceYF5用户让 Claude 解一道“三步将杀”国际象棋题。Claude 的思维链极长,图中展示的部分仅为其推演的约 1/10。后续仍在持续推演,未能及时给出最终答案。该案例展示了 Claude 在逻辑推理任务中可能过度思考的问题。AI模型Claude国际象棋推理模型推荐理由:看看 Claude 怎么死磕一道三步将杀,思维链长到离谱,最后还没完没了。原文稍后读已读值得跟进有用关注 Claude
15:21官方账号Anthropic@AnthropicAI76°Anthropic宣布Claude Fable 5将于明日全球恢复使用。在与美国政府对话后,模型新增了针对网络安全任务的分类器。短期内部分编码和调试任务将回退至Opus 4.8。Anthropic正与Amazon、Microsoft、Google等合作起草评估AI越狱的共识框架,并扩大与政府的模型测试协作。AI模型Claude Fable 5AnthropicOpus 4.810 个信源在谈事件专题推荐理由:Claude Fable 5终于回归了,加了新安全机制,暂时部分编程功能会降级到Opus 4.8,值得关注后续。原文稍后读已读值得跟进有用关注 Claude Fable 5
15:17AI SDK@aisdk87°Claude 推出 Claude Sonnet 5,这是其最智能体的 Sonnet 版本。该模型能自主制定计划并使用浏览器、终端等工具,运行自主性达到数月前仅更大更贵模型才能实现的水平。AI SDK 现已支持集成 Sonnet 5,开发者可快速调用其能力。AI模型Sonnet 5ClaudeAI SDK推荐理由:Claude 新出的 Sonnet 5 能自己调用浏览器和终端干活,比过去更聪明还便宜,AI SDK 直接就能用,赶紧试试。原文稍后读已读值得跟进有用关注 Sonnet 5
15:07@koltregaskes@koltregaskes精选美国解除出口管制后,Fable 5 模型于今日恢复全球可用。GPT-5.6 预计将很快发布。Fable 5 在订阅中免费额度占每周用量 50%,截至 7 月 7 日,之后转为积分消耗。新安全分类器以 99%+ 成功率阻挡了亚马逊报告的越狱攻击,而 Opus 4.8、GPT-5.5 和 Kimi K2.7 无需越狱即可识别同样漏洞。被阻挡的请求会重定向至 Opus 4.8。Mythos 5 仅限美国组织在 Project Glasswing 中使用。AI模型Fable 5GPT-5.6Opus 4.810 个信源在谈事件专题推荐理由:Fable 5 回来了,还顺带更新了安全分类器。GPT-5.6 也快了,想尝鲜的抓紧订阅,免费额度只到7月7日。原文稍后读已读值得跟进有用关注 Fable 5
14:29官方账号Greg Brockman@gdb83°OpenAI 推出 GeneBench-Pro,一个用于评估 AI 在计算生物学中处理判断密集型分析能力的基准。其问题需要人类专家 20-40 小时完成。GPT-5.6 Sol 在该基准上实现了显著提升,标志着模型在混乱生物数据中导航、选择分析路径和做出专业判断方面的进步。AI模型GeneBench-ProGPT-5.6 SolOpenAI10 个信源在谈事件专题推荐理由:OpenAI 搞了个新基准 GeneBench-Pro,专门测模型做复杂生物分析时的判断力,GPT-5.6 Sol 表现很亮眼,比之前强不少。原文稍后读已读值得跟进有用关注 GeneBench-Pro
13:49官方账号Greg Brockman@gdbOpenAI 的 Codex 模型在代码生成能力上获得开发者认可。Corey Quinn 公开承认此前低估了 Codex,并为此道歉。该模型能生成高质量代码,显著提升开发效率。AI模型CodexOpenAI编程助手10 个信源在谈事件专题推荐理由:OpenAI 的 Codex 现在写代码超强,连之前嫌弃它的人都道歉了,试试就知道有多好用。原文稍后读已读值得跟进有用关注 Codex
13:47Jerry Liu@jerryjliu0精选71°Anthropic宣布Claude Fable 5模型将在全球重新上线。该模型新增一组分类器,用于针对性地拦截更多网络安全任务。部分日常任务(如编码、调试)将回退至Opus 4.8。Anthropic正与亚马逊、微软、Google等起草共识框架,以评估AI越狱严重性并制定响应标准。公司还扩大与美国在模型测试和保障上的合作,包括预发布评估和联合研究。AI模型Claude Fable 5AnthropicAI安全10 个信源在谈事件专题推荐理由:Anthropic的Claude Fable 5重新上线了,加了安全过滤器,还联合亚马逊、微软等大厂搞越狱评估框架,挺有看头。原文稍后读已读值得跟进有用关注 Claude Fable 5
13:30官方一手歸藏(guizang.ai)@op741874°Fable 5 将于美国时间 7 月 1 日恢复全球上线,可在 Claude 平台、Claude Code、Claude CodeWork 使用。Pro、Max 和 Team 用户在 7 月 7 日前 Fable 包含在每周用量限额的 50% 以内,之后单独扣除积分。安全分类器设置了更大阈量,拒服概率可能更高。Sonnet 5 测试结果接近 Opus 4.8,但任务成本可能高于 Opus 4.8,甚至接近 Fable 5,用户反馈其会偷懒或拒绝执行任务。AI模型Fable 5Sonnet 5Anthropic10 个信源在谈事件专题推荐理由:Anthropic 昨天刚被爆出在系统提示里藏东西,今天就急着把 Fable 5 恢复上线,还附赠了 Sonnet 5 的成本 bug,挺热闹的。原文稍后读已读值得跟进有用关注 Fable 5
11:23小互@imxiaohu78°Anthropic 发布 Claude Sonnet 5,限时定价每百万 token 输入 $2、输出 $10,仅为旗舰 Opus 4.8($5/$25)的六成。官方评测显示,调高算力后 Sonnet 5 在部分任务上表现可追平 Opus 4.8。限时定价截至 2026 年 8 月 31 日,之后将涨至 $3/$15。AI模型Claude Sonnet 5Opus 4.8Anthropic10 个信源在谈事件专题推荐理由:Claude Sonnet 5 性价比很高,只要 Opus 4.8 六折的价格,部分任务还打平,适合想省钱的团队。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
11:22小互@imxiaohuAllen Institute 研究员使用 Claude 将以往需耗时两年的综述写作,完成了约十篇,其中多篇超过百页。UCSF 团队借助 Claude 对种系变异进行全流程分析,耗时缩短为原来的十分之一,结果经独立实验室验证。这些案例表明 Claude 在科研内容生成和生物信息学分析中能显著提升效率。AI模型ClaudeAllen InstituteUCSF推荐理由:Claude 帮科研人员大幅提效:写综述效率提升10倍以上,基因分析耗时缩至十分之一,还经过实验室验证。原文稍后读已读值得跟进有用关注 Claude
10:27官方一手歸藏(guizang.ai)@op741873°Anthropic 发布 Claude Sonnet 5,定位为最具智能体能力的 Sonnet 版本。它在多项基准测试中达到接近 Opus 4.8 的水平,能自主规划、使用浏览器和终端等工具,且运行成本更低。相比数月前需要更大更贵模型的任务,Sonnet 5 以更小的规模和价格实现了类似表现。AI模型Claude Sonnet 5Opus 4.8Anthropic10 个信源在谈事件专题推荐理由:Anthropic 出了新 Sonnet 5,分数快追上 Opus 4.8 了还便宜不少,能自己用浏览器干活,性价比很高。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
10:23官方一手歸藏(guizang.ai)@op7418美国商务部解除了对 Anthropic 旗下 Claude Fable 5 和 Mythos 5 模型的出口管制,Anthropic 宣布将于次日恢复这两个模型的访问权限。该决定结束了此前因政策限制导致的模型不可用状态。Anthropic 感谢用户的耐心及协助重新部署的合作者。AI模型Claude Fable 5Mythos 5Anthropic10 个信源在谈事件专题推荐理由:Anthropic 的 Claude Fable 5 和 Mythos 5 模型因出口管制被下架,现在解禁了,明天就能恢复使用。原文稍后读已读值得跟进有用关注 Claude Fable 5
09:34Poe@poe_platform72°Anthropic的Sonnet 5已在Poe平台上线,具备Opus级别的编码和推理能力,但成本显著降低。Google的Nano Banana 2 Lite以约4秒生成清晰一致图像,成为其最快图像模型。两个模型均可在Poe直接试用。AI模型Sonnet 5Nano Banana 2 LiteAnthropic10 个信源在谈事件专题推荐理由:Poe上新了!Anthropic的Sonnet 5编码强还便宜,Google的Nano Banana 2 Lite 4秒出图,快去试试。原文稍后读已读值得跟进有用关注 Sonnet 5
09:21官方账号Google DeepMind@GoogleDeepMindGoogle DeepMind 推出 Gemini Omni Flash,支持通过自然语言进行会话视频编辑。该模型可同时引用图片、文本和视频帧,组合多模态输入来操控视频动作。它还能利用真实世界知识,直接连接文字与图形到视频输出。目前已在 Google AI Studio、Gemini API 及 Gemini Enterprise Agent Platform 可用。AI模型Gemini Omni FlashGoogle DeepMind多模态推荐理由:Google DeepMind 的新模型 Gemini Omni Flash 能边聊天边剪视频,还能把文字和图片直接变成视频操作,很实用。现在在 Google AI Studio 就能试。原文稍后读已读值得跟进有用关注 Gemini Omni Flash
08:54berryxia@berryxiaGoogle推出Nano Banana 2 Lite图像模型,4秒内完成单次出图。同时发布Gemini Omni Flash多模态模型,支持视频生成和对话式编辑。两者串联形成从图像到视频的快速闭环,演示中上传照片后快速生成多个室内设计方案并直接动画化。该链路大幅降低生成成本,速度相比主流模型更激进。AI模型Nano Banana 2 LiteGemini Omni FlashGoogle10 个信源在谈事件专题推荐理由:Google把Nano Banana 2 Lite和Omni Flash串起来,先4秒出图再直出动画,比主流模型快且便宜。创意迭代更爽。原文稍后读已读值得跟进有用关注 Nano Banana 2 Lite
08:52小互@imxiaohu据爆料,Google 将在今晚发布代号为🍌的新模型和低配版 Omni 模型。同时,Anthropic 的 Claude Sonnet 5 也预计在今晚发布。OpenAI 目前尚无相关动态。AI模型GoogleClaude Sonnet 5Anthropic10 个信源在谈事件专题推荐理由:听说了吗?Google 和 Anthropic 今晚可能要发新模型,Claude Sonnet 5 和 Google 新模型,可以蹲一下。原文稍后读已读值得跟进有用关注 Google
08:29官方账号Allen AI (Ai2)@allen_ai艾伦人工智能研究所发布了DiScoFormer模型,用于更精确地估计评分函数(score function)。该评分函数指引AI图像生成器朝向概率更高的图像,类似于贝叶斯采样和等离子体物理中的原理。DiScoFormer在处理复杂数据时显著优于现有方法,提升了生成质量。AI模型DiScoFormerAllen AI评分函数推荐理由:艾伦AI发了DiScoFormer,能更准地估计评分函数,处理复杂数据比之前强,适合搞图像生成的看看。原文稍后读已读值得跟进有用关注 DiScoFormer
08:21OpenRouter@OpenRouterAIOpenRouter 持续在 GPQA 和 TAU-Bench 上测试多数开放权重模型,并公开发布结果。这些数据用于其 AutoExacto 元基准,该基准默认用于路由工具调用。在最新排名中,Parasail.io 和 Zai_org 位列第一。AI模型OpenRouterGPQATAU-Bench2 个信源在谈事件专题推荐理由:想知道哪些开放权重模型在 GPQA 和 TAU-Bench 上表现最好?OpenRouter 每周跑分、公开排名,还能帮你选最靠谱的推理服务。原文稍后读已读值得跟进有用关注 OpenRouter
08:17shao__meng@shao__mengClaude Sonnet 5 是 Anthropic 最新发布的 Sonnet 系列模型,强调其自主规划、使用浏览器和终端等工具的能力。官方给出的性能排序为 Sonnet 4.6 < Sonnet 5 < Opus 4.8 < Fable 5 < GPT-5.6 Sol,表明 Sonnet 5 超越了上一代但低于更强模型。其自主运行水平达到前几个月需要更大更贵模型才能实现的程度。该模型定位为更高效的 Agent 方案。AI模型Claude Sonnet 5Claude智能体10 个信源在谈事件专题推荐理由:Anthropic 出了 Sonnet 5,能自己规划任务、用浏览器和命令行,比 Sonnet 4.6 强,但比 Opus 便宜,适合想搞 Agent 又不想花大钱的人。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
08:14Claude@claudeai91°Anthropic 推出 Claude Sonnet 5,定位为最具 agentic 能力的 Sonnet 模型。它能够自主制定计划,并使用浏览器、终端等工具执行任务。据称其自主运行能力达到了几个月前需要更大、更昂贵模型(如 Opus 级别)才能实现的水平。该模型通过 Twitter 发布,已获得 3000+ 转发和 31000+ 点赞。AI模型Claude Sonnet 5Anthropic智能体10 个信源在谈事件专题推荐理由:Anthropic 新出的 Sonnet 5 能自己用浏览器和终端干活,自主性堪比之前更大更贵的模型,值得看看。原文稍后读已读值得跟进有用关注 Claude Sonnet 5
08:12Claude@claudeai88°Anthropic 推出 Claude Sonnet 5,早期合作伙伴发现它能完成之前 Sonnet 系列中断的复杂任务。该模型无需提示即可自动检查自身输出。它还能以有吸引力的价格执行完整的智能体工作。AI模型ClaudeSonnet 5Anthropic10 个信源在谈事件专题推荐理由:Anthropic 新出的 Sonnet 5 能自己检查结果,做复杂任务还便宜,挺靠谱的。原文稍后读已读值得跟进有用关注 Claude
07:16Cognition@cognition_labsCognition 发布了 FrontierCode (Extended) 基准,用于评估真实世界编程任务的可合并性和质量。Claude Sonnet 5 在该基准上得分 53.8%,通过率为 57.6%。该成绩高于 Opus 4.8 的表现,但 Cognition 表示随着后续基准调整,相对排名可能发生变化。AI模型ClaudeSonnet 5FrontierCode推荐理由:Cognition 用 FrontierCode 实测了 Sonnet 5 的工程能力,它比 Opus 4.8 更强,值得关注。原文稍后读已读值得跟进有用关注 Claude