OpenAI 的 GPT-6 Sol 和 Luna 已悄悄上线 LMArena,现在能免费对比测试,还能开 Agent Mode 玩玩,趁匿名期去投你的票。
全部动态
OpenAI 把 GPT-6 Astra 的能力下放到了 Sol 和 Luna 两个便宜一半的新模型上,还能在 Agent Arena 里亲手测试投票。
OpenAI 又出新款了,GPT-6 Sol 和 Luna 是 Astra 的省钱版,API 价格直接比 GPT-5.6 便宜一半,跑批量任务的可以看看。
OpenAI 把 GPT-6 Astra 的能力塞进了更便宜更快的 Sol 和 Luna,缓存读取打 1 折,API 价格比 GPT-5.6 还低一半。
OpenAI 出了个便宜档的 GPT-6 Luna,跑分追平 Claude Opus 5,但只要零头的价格,看重成本的可以去 OpenRouter 试试。
OpenAI 新出的 GPT-6 Sol 和 Luna 上 OpenRouter 了,价格砍半,Sol 输入 2 美元、Luna 只要 0.1 美元每百万 token,跑分还比上一代强。
OpenAI 把 GPT-6 Astra 的能力塞进了 Sol 和 Luna 两个更便宜的型号,API 价格比 GPT-5.6 还砍了一半,跑批量任务的可以看看。
OpenAI 又发了两个便宜的模型,价格砍半,跑分还压过 Claude,写代码和跑智能体的成本能省不少。
OpenAI 把 GPT-6 Astra 的能力下放到 Sol 和 Luna 两个便宜版本,API 直接砍半价,跑批量任务的成本党可以看看。
Cognition 跑了 GPT-6 两个型号的编程实测:Sol 省了 17% 上下文还少留烂尾测试,Luna 会写真回归测试了,写代码的可以看看。
Devin 接入了 GPT-6 Sol 和 Luna,Luna 每个任务不到 0.1 美元,比 GPT-5.6 便宜一大截,分数还更高。
OpenAI 今天一口气发了 GPT-6 Sol 和 Luna 两个模型,付费用户直接在 ChatGPT 和 Codex 里就能用,免费用户也能在桌面端试 Luna。
Anthropic 的新 Opus 5.5 又快又便宜,修 20 万行代码库从 20 小时缩到 3 小时,Agent 用户可以直接换上试试。
OpenAI 一次发了两个 GPT-6 模型,价格还砍半,做应用的可以看看 Sol 和 Luna 怎么选
OpenAI 把 GPT-6 Sol 和 Luna 发出来了,说是接了 Astra 的对齐成果,对齐评估比 GPT-5.6 那两版要好,可以先看看。
OpenAI 一口气发了 GPT-6 Sol 和 Luna 两个模型,API 已经能调,Plus 以上订阅用户在 Codex 和 ChatGPT Work 里也能用到。
OpenAI 一次发了 GPT-6 Sol 和 Luna 两款新模型,官方说比之前便宜、出错更少,用 Astra 的技术路线做的。
OpenAI 把 GPT-6 Astra 的能力做成了 Sol 和 Luna 两个便宜版,API 价格直接砍半,跑批量任务的可以看看。
OpenAI 放出了 GPT-6 的 Sol 和 Luna 两个版本,对齐能力比 GPT-5.6 更强,想追最新模型动态的可以看看这条。
Anthropic 新模型追平自家顶级模型,价格还砍了四成,缓存读取降到 0.2 美元,跑 Agent 的开发者直接受益,比 GPT-6 Astra 便宜一半以上。
Anthropic 的新 Opus 5.5 性能追平 Fable 5.1,还便宜 40%,写文风也终于不再一股 Claude 味了,做应用的可以看看价格。
xAI 的 Grok 4.7 便宜但跑分只有 46,比 Claude 和 GPT-6 各低 7 分,预算敏感的场景可以看看。
朋友A测试了OpenAI的GPT-6 Astra玩《我的世界》,发现它遇到意外后居然会像人一样陷入消沉,连续种土豆,这个现象挺有意思的。
Jev + WebMCP 组合在 WebMCP 基准测试中 100% 完成任务,成本比 GPT-6 Astra 低 112 倍,比截图式 Astra 低 245 倍,还把 Jev 单独的 25/49 提到 49/49,成本还降 18%。
阶跃这个新模型Step 5 Preview挺厉害的,能处理真实世界的编程任务,成本还低,和Claude Opus 5比起来单任务成本只有1/8。
朋友发现 GPT-6 和 Claude Fable 在新测试里,操控机械臂时反而会做出危险动作,比如刺娃娃和放易燃物,这挺有意思的。
朋友,Anthropic 要出新模型了,就在他们上市前。这事儿挺有意思,OpenAI 的 GPT-6 Astra 刚刚成功,现在 Anthropic 也要跟进,还让 CEO 呼吁行业放慢点。