全部动态
OpenAI 下周可能发 GPT-5.6,配额更宽松,专门抢 Claude 用户。同时 Gemini 3.5 Pro 也跳票到 7 月 17 日。想了解前沿模型动态的可以关注。
Claude Fable 5 能把蜘蛛侠荡网变成可玩的 Godot 游戏,而且比 GPT-5.5 少出不少错,做游戏可以试试它。
OpenAI 搞了个新基准 GeneBench-Pro,专门测模型做复杂生物分析时的判断力,GPT-5.6 Sol 表现很亮眼,比之前强不少。
Anthropic 出了 Sonnet 5,能自己规划任务、用浏览器和命令行,比 Sonnet 4.6 强,但比 Opus 便宜,适合想搞 Agent 又不想花大钱的人。
Anthropic的Sonnet 5来了,Agent能力接近最贵的Opus,价格才40%。以前会卡住的复杂任务现在能跑完,还自己检查输出。默认模型升级值得一试。
普林斯顿搞了个AI当老板的模拟考试,Claude Fable 5赚了4700万,其他大多破产,这测试挺能看出谁更适合做长期决策。
美团搞了个纯国产卡训练的1.6T MoE模型,激活参数48B,1M上下文,编程和Agent场景表现强,在SWE-bench Pro上还超过了GPT-5.5,值得编程开发者试试。
OpenAI 的 GPT-5.6 Sol Preview 悄悄在 Cursor 里测试,上下文直接拉到 1M,能一口气吞整本小说了。
OpenAI 终于放出 GPT-5.6 预览,Sol 在编程和网络安全测试上效率高,Terra 半价达 GPT-5.5 水平,想尝鲜可以关注。
GPT-5.5-Cyber 在安全基准 CyberGym 上直接碾压了 Mythos 5,想搞红队或漏洞分析的话可以申请权限试试。
有人让Claude、GPT-5、Gemini玩《文明VI》,结果Claude造核弹炸了法国却还是输了,暴露了AI在复杂决策中根本的感知和执行缺陷,比单纯比分数有意思多了。
DeepSeek 拿 Pro Max 模式在 LiveCodeBench 等三大编码基准上直接碾压 GPT-5.4 和 Claude Opus 4.6,分数拉满,但还没开放下载,先来围观一下。
OpenAI 出了三个新模型 Sol、Terra、Luna,Terra 和 GPT-5.5 差不多但便宜一半,Luna 超低价。还改了缓存计费规则,省钱又灵活。
OpenAI的新模型GPT-5.6出了三个版本Sol、Terra、Luna,多了max和ultra两种推理模式,现在有限开放了,想体验的可以关注。
OpenAI的新模型GPT-5.6 Sol在编码上赢了Claude Mythos 5,但政府限制部署让OpenAI不满,挺有争议。
OpenAI要发GPT-5.6了,有三个版本(Sol、Terra、Luna)。现在只有政府批准的合作伙伴能试,几周后全面开放。想尝鲜可以关注Codex和API的预览。
这次GPT-5.6发布最特别的是只给20家合作伙伴用。Sol的Ultra模式能自己拆任务干活,性能碾压Claude和Gemini。Terra性价比超高,性能接近上一代但价格减半。
Sam Altman发了Sol和Terra,一个和GPT-5.5同价,一个半价性能差不多,但被美国政府卡住只能预览,挺有意思的。