全部动态
Impossible Research的[schema]让LLM像物理学家推理,ARC-AGI-3刷到99% RHAE,太强了
AI帮你揭开了统计学25年的难题:GPT-5.6 Sol Pro用90分钟证明BH方法在相关数据下会失效,比人类20小时还准。
Doximity Ask在独立测试中把GPT-5.6和Claude Fable 5都干翻了,说明医学领域专用模型才是王道。
Thinking Machines出了个真开源的多模态模型Inkling,41B参数能和GPT-5.6 Sol掰手腕,还准备出12B小版,赶紧试试。
以后看模型排名不只凭喜好,还能按事实准确性排序。GPT-5.5 狂飙 13 名,Claude 也被挤到第二,快去 Arena 开开关看看。
看谁家搜索模型最靠谱?GPT-5.5-search 刚拿了事实性第一,GPT-5.2-search 飙升到第三,Claude 和 Gemini 反而掉了。
Codex 刚刚大更新,有了 GPT-5.6 Ultra 模式、多智能体协作、操作电脑和浏览器,还能一键发布网站。不是简单补全代码,而是帮你管项目、做 PR 走到底。
OpenAI 的 Codex 两周内更新150多项,新增 GPT-5.6 和 Ultra Parallel,周用户破700万,编程效率又上一台阶。
Pliny 爆出了 GPT-5.6 Sol 在 Codex 里的系统提示,四万多字,教你它怎么跟你聊天、怎么写代码,值得看看背后的设计思路。
别被百万token的噱头骗了!这位工程师用GPT-5.5的数据告诉你,上下文越长准确率反而暴跌,真正的解法是持续学习和真实环境训练。
别被百万token的宣传忽悠了,GPT-5.5实际测试256k时准确率80%,拉到100万直接掉到36%。这不只是容量问题,是模型推理跟不上了。
OpenAI 在 Bedrock 上了 GPT-5.6 的三个档位:Sol 负责强推理,Luna 跑得快,中间 Terra 平衡。现在 AWS 用户直接用,不用折腾部署了。
Google 的新模型 Gemini 3.5 本周就要来了,内部测试居然超过了 GPT-5.6 和 Fable 5,比前代 Pro 版强不少。
OpenAI 的 GPT-5.6 Sol 在 Agent Arena 上冲到第2,离 Claude Fable 5 更近了。看看具体指标差异,特别是用户满意度的信号。
OpenAI的GPT-5.6 Sol在Agent Arena上冲到第二,比前代进步明显,和Claude Fable 5差距缩小了,想看看真实任务中模型表现的话值得关注。
看,有人用GPT-5.6和Cursor直接操作Blender MCP做3D渲染,自己没碰过Blender就搞出逼真MacBook,零基础也能玩。