#推理模型
Anthropic 推出 Sonnet 5.5,价格不变但性能大增,成本降三成,速度提三成,特别适合编程和文档工作。
Sonnet 5.5 速度比 Opus 快 30%,成绩还追平自家旗舰,价格没涨,干活的性价比党可以直接看看。
Anthropic 的 Claude Opus 5.5 写作风格大变,破折号几乎不用了,分号也少了七成,句子更短更自然,写东西更不像 AI 腔。
Sonnet 5.5 编程测试居然比 Opus 5.5 还高 4 分,价格只要 $2/$10,但开了 max 档费用会飙升,用的时候注意。
模拟电路版 SWE-bench 来了:50 个真实设计任务,15 种智能体跑 2250 次实验,DeepSeek V4 Pro 靠参考拓扑涨了 18.7 个点。
清华团队提出 TaH2,让循环 Transformer 只对需要的 token 多迭代,AIME 上同等算力多拿 3.4 分,代码已开源。
用 Sonnet 5.5 前先看这篇:max 深度下 token 消耗几乎和 Opus 5.5 一样,选档位前算算账。
OpenAI 把 GPT-6 Sol 短暂开放到 Arena 的 Direct Mode,想去试试新模型手感的可以抓紧这 24 小时。
Keras 作者 Chollet 说自己已经不写代码了,靠给推理模型下指令加上测试、审计、可视化来掌控系统,思路很具体,程序员可以参考他的做法。
月之暗面的 Kimi K3.1 被开发者从 API 后台挖出来了,100 万上下文加三档推理强度,定价可能和 K3 持平。
AT&T 每天 450 亿 token 的账单太吓人了,他们要把开源模型占比拉到 70%,FT 这篇讲清了美国企业为什么开始算小账。
有人实测了 Claude Opus 5.5 做视觉设计,说是目前所有模型里最强的,视频里有实际效果,做前端设计的可以看看对比。