全部动态
有人拿 Claude Opus 5.5 加 Three.js 做了个演示,随手画的草图直接生成四阶段演进的 3D 房屋,做前端的可以看看思路。
OpenAI 新出的 GPT-6 Sol 和 Luna 便宜了一半,Sol 跑分还超过了 Claude Opus 5,做大批量任务可以认真看看这个定价。
Claude Opus 5.5 和 GPT-6 Sol 都上了 Arena,可以直接并排看两个模型的输出,还能自己上手测。
OpenAI 新的 GPT-6 Sol 在真实用户投票的 Code Arena 拿了第4,价格只要 Claude Opus 5 的一半不到,做 Web 开发的可以看看分数再决定用哪个。
OpenAI 一次出了 GPT-6 Sol 和 Luna 两个模型,价格砍半还带新缓存,跑业务任务比 Claude Opus 5 便宜九成,做 API 应用的可以看看。
Anthropic 的新 Opus 5.5 比上一代便宜四成、快三成,写代码和文字水平赶上 Fable 5.1,挑模型时可以对比看看。
小米把 MiMo-V2.6 整套开源了,Pro 在智能体基准上打平 Claude Opus 5,本地跑前沿模型的门槛又降了。
Claude Opus 5.5 在 FrontierCode 编程基准上,思考档位调到 med 和 max 成绩差不多,还比 high 高,省钱党可以看下再选档位。
Anthropic 的 Claude Opus 5.5 出来了,编程测试跑赢 Fable 5.1,API 价格还不到对方一半,付费用户限额也变宽了。
Claude Opus 5.5 刚出就成了 AINews 的默认模型,OpenAI 的 GPT6 反而被抢了风头,各家还集体降价 40-50%,降价后入手正合适。
Anthropic 给 Opus 5.5 出的官方调参清单,从 effort 挡位到防假完成都有,老用户升级前值得照着改一遍自己的 harness。
Anthropic 把 Claude Opus 5.5 发出来了,一天跑完 68 万行代码迁移,API 还降价到 8 折,缓存读取便宜了 60%,写代码的可以看看。
Anthropic 新模型 Opus 5.5 已经能在 Genspark 里直接用了,比 Opus 5 便宜四成还快三成,写代码和聊天都可以试试。
一天之内 Opus 5.5、GPT-6 Sol/Luna、Grok 4.7、Mimo v2.6 全来了,Opus 5.5 还降了 40% 成本,这篇帮你梳理各家提升方向和 benchmark。
浏览器操作智能体的性价比榜刷新了,GPT-6 Sol 比.Opus 便宜三倍还高分,挑模型前可以看看这份数据。
Anthropic 出了 Claude Opus 5.5,能力对标 Fable 5.1,价格还降了 40%,写代码的用户可以直接换上试试。
Simon Willison 把 Claude Opus 5.5 和 GPT-6 两个版本放在同一套画鹈鹕测试里对比,想快速了解三者差别看这篇就够了。
这篇论文造了个很较真的基准:不看智能体能不能把指标刷上去,只看它交付的模型到底行不行,连"训练了但没学到东西"这种静默失败都能抓住,四个前沿模型全被拉出来和人类工程师对比。
Anthropic 和 OpenAI 前后脚发新模型还互相砍价,GPT-6 Luna 只要 $0.10/M,做应用的成本又降一半,附完整价格对比表。
用 Simon Willison 的 llm 命令行工具的话,升级到 0.29 就能在终端里直接调 Claude Opus 5.5 了。
LlamaIndex 跑了 ParseBench,Opus 5.5 解析 PDF 表格比 Opus 5 高 7 个点,但每页 5.8 美分不便宜,文中还对比了 LlamaParse 的替代方案。
Vercel 又更新 Next.js 评测了,GPT-6 Sol 首秀就并列第一,Grok 4.7 便宜一半到七倍,选模型前可以看看这份榜单。
Augment Code 的 Cosmos 平台接入了 Claude Opus 5.5,跑智能体任务只要 Opus 5 四成的钱,重度用户可以关注一下。
OpenAI 把 Astra 的能力做成大中小三档,Sol 跑分超 Claude Opus 5 但成本只有 9%,跑长任务智能体的开发者账单能省不少。
Anthropic 的 Alex Albert 晒了用 Opus 5.5 加 Blender 一句话生成 1906 年旧金山街景的视频,3D 建模能力确实变强了。
Lovable 把 Claude Opus 5.5 和 GPT-6 Sol 都接进来了,还能自动帮你选模型,写应用不用纠结用哪个了。
Anthropic 放出了 Claude Opus 5.5 的早期试用片段,有人拿它写了一篇西瓜短篇故事,想看新模型写作水平的可以围观。
OpenAI 出了个便宜档的 GPT-6 Luna,跑分追平 Claude Opus 5,但只要零头的价格,看重成本的可以去 OpenRouter 试试。
OpenAI 又发了两个便宜的模型,价格砍半,跑分还压过 Claude,写代码和跑智能体的成本能省不少。
Anthropic 把 Opus 升到了 5.5,写代码跑智能体任务的朋友可以留意,官方说这三块能力都是最强的。
Claude Opus 5.5 上线 GitHub Copilot 了,跟 Opus 5 效果差不多但省不少 token,写代码跑长任务可以试试,CLI 和 VS Code 里就能用。
Anthropic拟10月在新加坡设亚太第五个办事处 开放本地招聘 数据显示,按人口比例计算,新加坡的Claude.ai使用水平在121个国家中排名第二。 我们观察到,人工智能公司Anthropic计划于10月在新加坡设立其亚太地区的第五…
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…