谷歌新出的Gemini 3.7 Flash在智能体评测里冲到第20,比上代强一截,编码和网页开发更好用了,感兴趣的可以试试。
全部动态
Grok-4.6 刚发布就把网页开发能力冲进第一梯队,分数压过 Claude 和 GPT 的最新版,差距只有个位数,写代码的可以关注下。
Grok 4.6 已经能在 Devin 里用了,Desktop 和 CLI 都支持,比 GPT-5.6 Sol 强,仅次于 Opus 5 和 Fable 5,想尝鲜的赶紧试试。
Grok 4.6发布,价格不变,Agent和编程更强,AA Intelligence Index追平GPT-5.6 Sol,API输入2美元/百万Token。
DeepSeek新模型V4-Pro专攻代码生成,在Code Arena排第8,开源第2,仅次于Kimi K3,还超过了GPT-5.6 Sol。
DeepSeek新模型在Text Arena拿1465分,和GLM-5.1、GPT-5.6 Terra一个水平,开源阵营排第五。
DeepSeek 又发新模型了,V4-Pro (Max) 在编码榜上排开源第二,比贵得多的 Opus-4.8 还强,价格只要零头。
xAI 把 Grok 4.6 放出来了,网页开发能力直接冲到 LMArena 第7,跟 GPT-5.6 和 Claude 最新版就几分之差,这代提升挺猛。
Simon Willison 说 Claude Haiku 幻觉多,不如 GPT-5.6-Luna,还会污染 Claude Code 抓网页,用起来要小心。
OpenAI出了个Daybreak Red,能让安全研究员用GPT-5.6-Cyber这类专用模型搞漏洞测试,比通用模型更对口。
GPT-5.6 Sol 来了,OpenAI 顺手把 ChatGPT Work 和 Codex 付费用户的用量限制清零重置,等于这段时间随便用。快看看你账号恢复了没?
Jerry Liu说别急着用前沿模型做文档OCR,LlamaParse在表格图表上准确率涨了15%,还能自己搭ParseBench跑评测。
Simon用GPT-5.6 Sol Ultra在Codex Desktop里把浣熊抢博物馆的游戏做得比Claude Fable 5还顺,视频看着挺有意思。
看Opus 5和GPT-5.6-Sol在同一基准上的表现,一个越强越费token,一个越强越省,挺有意思的对比。
OpenRouter把GPT-5.6 Luna价格砍到十分之一,结果用量涨了十倍,还超过了GLM 5.2,看看降价怎么把量拉起来。
OpenAI把GPT-5.6拆成Sol和Luna,付费用户用Sol,免费用户也能无限聊Luna。想不花钱体验新模型的可以明天试试。
OpenAI 模型命名总绕晕人,Simon 这条提问正好点破,想弄懂 ChatGPT 和 API 对应关系可以看下。
OpenAI 给 GPT-5.6 Sol 日常版加了个新滑块,Plus/Pro 用户今天就能在 Chat 里试。