14:58IT之家(博客/媒体)78°Ox Alpha AI模型上线限免,DeepSWE跑分达80%,优于Claude Fable 5的65%。模型支持多模态输入,与智谱架构高度吻合。AI模型Ox AlphaDeepSWEClaude Fable 55 个信源在谈事件专题推荐理由:Ox Alpha模型免费限免,DeepSWE跑分领先,多模态输入,与智谱架构相似,值得一试。原文稍后读已读值得跟进有用关注 Ox Alpha
15:06orange.ai@oran_geBen Davis 在 x.com 上分享,DeepSWE 在 10 项任务中表现优于 Fable 和 GPT-5.6-sol,得分超过 80%,引发热议。AI模型DeepSWEFableGPT-5.6-sol推荐理由:Ben Davis 在 x.com 上展示了 DeepSWE 在多项任务中的出色表现,比 Fable 和 GPT-5.6-sol 更胜一筹,值得关注。原文稍后读已读值得跟进有用关注 DeepSWE
10:25官方一手Pandaily@contact@pandaily.com (Pandaily)DeepSeek 于8月13日宣布 V4 系列 API 调价,8月17日生效。新方案采用峰谷定价,非高峰时段价格为高峰的一半。V4 Pro 输入缓存命中的非高峰价格涨幅最高达500%。同时,V4-Pro-0813 模型的 DeepSWE 得分从7.3跃升至62.7。AI产品DeepSeekV4API定价推荐理由:DeepSeek 把 V4 API 价格调高了,最高 500%。非高峰时段半价,要省钱就避开高峰,8月17日就改。原文稍后读已读值得跟进有用关注 DeepSeek
20:08AI Will@FinanceYF5精选79°DeepSeek V4 Flash 官方API现已开启公测,重点升级Agent能力。Terminal Bench 2.1得分82.7,DeepSWE得分54.4,多项成绩大幅超过V4 Pro Preview。该模型还接近Opus 4.8的表现,并原生支持Responses API格式,现已适配Codex。AI模型DeepSeekV4 Flash智能体推荐理由:DeepSeek V4 Flash 公测了,Agent 跑分比 V4 Pro 高不少,还原生支持 Responses API,玩 Codex 的可以直接试。原文稍后读已读值得跟进有用关注 DeepSeek
11:34shao__meng@shao__meng72°Together Compute 团队在 DeepSWE 基准上对比了 Kimi K3 max 和 GPT-5.6 Sol max。单次测试 pass@1 中 GPT 为 72.7%,Kimi 为 68.5%;但多次测试中 Kimi 反超,pass@4 达 89.4% 对 GPT 的 85.8%。成本方面 Kimi 约 $4.65/rollout,GPT 约 $8.37;每 $100 预算 Kimi 可解 14.7 题,GPT 仅 5.3 题。语言专长上 Kimi 在 Rust 更强(65-60),GPT 在 Python/TS/JS 更强。两模型任务级相关仅 0.46,组合覆盖率达 95.6%,推荐级联策略:先 Kimi 再 GPT,可达到 85.6% 解题率且成本更低。AI模型Kimi K3 maxGPT-5.6 Sol maxDeepSWE2 个信源在谈事件专题推荐理由:Together Compute 下了个对比,Kimi 和 GPT 在修 bug 上各有绝活,组合用比单干划算得多。原文稍后读已读值得跟进有用关注 Kimi K3 max
07:01官方账号Together AI@togethercompute精选使用DeepSWE基准对比了Kimi K3 Max和GPT 5.6 Sol Max在软件工程任务上的表现。Kimi K3 Max达到了与GPT 5.6 Sol Max相当的性能,而价格仅为后者的约55%。将两个模型联合使用时,性能可额外提升约16%。AI模型Kimi K3 MaxGPT 5.6 Sol MaxDeepSWE1 个信源在谈事件专题推荐理由:Kimi K3 Max性价比炸裂,软件工程能力不输GPT 5.6 Sol Max,混合使用还能再提分,值得关注。原文稍后读已读值得跟进有用关注 Kimi K3 Max
17:06Thomas Wolf@Thom_WolfPoolside AI 发布最新 agentic coding 模型 Laguna S 2.1。在 Terminal-Bench 2.1 上得分 70.2,与 5-25 倍大小的模型并列甚至领先。在 DeepSWE 基准上得分 40.4,超越部分超 1T 参数的开源模型。该模型可在单个 DGX Spark 或 Mac 上本地运行。AI模型LagunaPoolsideTerminal-Bench8 个信源在谈事件专题推荐理由:Poolside 又出了个厉害编码模型,Laguna S 2.1 在本地就能跑,多项基准比大它几十倍的模型还强。原文稍后读已读值得跟进有用关注 Laguna
15:31@koltregaskes@koltregaskes76°Google发布Gemini 3.6 Flash,定位高效工作模型。在DeepSWE基准上得分从37%提升至49%,每任务成本降低52%,输出token减少65%。AI Index得分保持在50,推理成本降低17%,输出速度达280 tokens/s。该模型与GPT-5.6 Luna(51分)和Claude Sonnet 5竞争,但更快更便宜。Google优化了高吞吐量代理工作流的部署效率。AI模型Gemini 3.6 FlashGoogleDeepSWE10 个信源在谈事件专题推荐理由:想要又快又便宜的模型?Gemini 3.6 Flash在DeepSWE上冲到49%,成本砍半,跑agent任务很合适。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
18:33AI Will@FinanceYF5分析了Kimi K3和Fable 5在DeepSWE基准上的软件工程任务表现。结果指出开源模型与闭源模型的差距已缩小至6个月内。Kimi K3在代码生成和修复子任务中表现接近前沿闭源模型。Fable 5在部分指标上展现出竞争力。AI模型Kimi K3Fable 5DeepSWE10 个信源在谈事件专题推荐理由:看看Kimi K3和Fable 5在DeepSWE基准上怎么比,开源模型追上闭源了吗?原文稍后读已读值得跟进有用关注 Kimi K3
04:12Aravind Srinivas@AravSrinivasTogether AI 在 DeepSWE 基准上对比了 Kimi K3 与 Claude Fable 5 的软件工程任务表现。结果显示,Kimi K3 以 Fable 5 约 35% 的价格实现了相同性能,且在更高 pass@k 指标上领先。该分析来自 Together AI 的 Arav Srinivas,数据基于内部测试。AI模型Kimi K3Claude Fable 5Together AI10 个信源在谈事件专题推荐理由:想省钱又要强性能?Kimi K3 在编程任务上和 Claude Fable 5 打个平手,价格只要三分之一,高要求场景还更强。原文稍后读已读值得跟进有用关注 Kimi K3
09:38官方账号Together AI@togethercomputeTogetherCompute使用DeepSWE评估了Kimi K3与Claude Fable 5在软件工程任务上的表现。Kimi K3以约35%的价格达到与Claude Fable 5相同的性能水平。在更高的pass@k指标上,Kimi K3甚至领先于Claude Fable 5。该分析为开发者提供了性价比更高的模型选择参考。AI模型Kimi K3Claude Fable 5DeepSWE10 个信源在谈事件专题推荐理由:如果你写代码,Kimi K3花不到一半的钱就能干和Claude Fable 5一样好的活,高通过率时还更强。原文稍后读已读值得跟进有用关注 Kimi K3
02:45@koltregaskes@koltregaskesGPT-5.6 Sol max 和 xhigh 在 DeepSWE 排行榜上超过了 Fable 5 xhigh 和 max。两者的平均成本更低,输出 token 更少、步骤更少。GPT-5.6 Tera max 得分与 Fable 几乎相同。这些结果表明 GPT-5.6 系列在软件工程任务上具有竞争力。AI模型GPT-5.6DeepSWEFable 56 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 新变体在 DeepSWE 上干过了 Fable 5,还更便宜更快,值得关注。原文稍后读已读值得跟进有用关注 GPT-5.6
07:43Geek@geekbbxAI 发布了 Grok 4.5,定位为目前最强模型,专注于编程、Agent 任务与知识工作。该模型与 Cursor 联合训练,在 DeepSWE 1.0(pass@1)基准上得分 62.0%,低于 Fable max(66.1%)和 GPT 5.5 xhigh(64.31%),但高于 Opus 4.8 max(55.75%)和 Opus 4.7 max(40.12%)。Grok 4.5 在 Grok Build 和 Cursor 中限时免费提供。AI模型Grok 4.5xAICursor10 个信源在谈事件专题推荐理由:xAI 发了新模型 Grok 4.5,编程和 Agent 能力很强,还跟 Cursor 联训,现在免费体验。原文稍后读已读值得跟进有用关注 Grok 4.5
15:25@koltregaskes@koltregaskesGLM-5.2 在 DeepSWE 编程基准上取得 44% 的得分,超过 Kimi-K2.7 Code,成为目前最强的开源模型。不过它的运行成本更高,且每次输出更多 tokens。与封闭模型相比,Claude Fable 5 以 70% 的得分领先,差距明显。AI模型GLM-5.2Kimi-K2.7DeepSWE推荐理由:智谱的 GLM-5.2 代码上刚赢了 Kimi 的 K2.7,但更贵输出也更多,离顶级闭源还有距离。原文稍后读已读值得跟进有用关注 GLM-5.2
15:09官方账号Artificial Analysis@ArtificialAnlys73°Artificial Analysis 更新了其编程智能体指数,用 Datacurve 的 DeepSWE 基准测试取代了 SWE-Bench Pro。DeepSWE 从零编写任务,避免模型从公开 GitHub 问题或 PR 中记忆答案,解决了原基准可被游戏化的问题。更新后,Codex with GPT-5.5 (xhigh) 得分从 65 升至 76,超越 Claude Code with Opus 4.8 (max) 的 73 分;新发布的 Claude Fable 5 (max) 在 Claude Code 中以 77 分位居榜首。这一变化揭示了原基准对某些模型组合的偏差。AI产品编程智能体基准测试Claude Fable 510 个信源在谈事件专题推荐理由:基准测试更新直接影响了主流编程智能体的排名,做 AI 编程工具选型或评估模型能力的开发者值得关注——Claude Fable 5 新登顶,Codex 也大幅提升,建议点开看具体得分和对比。原文稍后读已读值得跟进有用关注 编程智能体
12:23Viking@vikingmuteDeepSWE 是一个全新的 coding benchmark,所有任务均为原创、从零编写,避免了模型预训练数据记忆污染。任务涵盖多种编程语言,复杂度接近真实世界,参考解决方案平均需修改 668 行代码。排行榜显示 GPT-5.5 xhigh 通过率最高,GPT-5.4 xhigh 第二,其他模型通过率较低。小米的模型表现意外不错,值得关注。AI模型coding benchmarkDeepSWEGPT-5.5推荐理由:这个基准测试解决了现有 coding benchmark 数据污染问题,做 AI 编程模型评估的团队可以直接参考排行榜,小米模型的表现值得一试。原文稍后读已读值得跟进有用关注 coding benchmark