AI模型精选73°

GPT6-Astra评测:编程能力与Claude Opus 5相当

著名播客潜空间对GPT6-Astra 的长篇评论,集合了多方评测,简单总结: 1. GPT6-Astra 在 Coding Agent能力上与Claude Opus 5、Fable 5差不多,但落后...

精选理由

OpenAI的GPT6-Astra评测曝光,编程能力与Claude Opus 5相当,但价格涨2.5倍,因效率提升实际成本反而降一半。

AI 摘要

GPT6-Astra在Coding Agent能力上与Claude Opus 5、Fable 5相当,但落后于Fable 5.1。综合智能指数部分维度甚至落后于GPT5.6。Token效率高,Computer Use等特定任务表现优秀。ARC-AGI-3在OpenAI特殊适配Harness上达到99%,标准跑分仅63%。模型不显示推理过程时能完成更复杂任务,但带来安全风险。

原文 · 向阳乔木

著名播客潜空间对GPT6-Astra 的长篇评论,集合了多方评测,简单总结: 1. GPT6-Astra 在 Coding Agent能力上与Claude Opus 5、Fable 5差不多,但落后...

著名播客潜空间对GPT6-Astra 的长篇评论,集合了多方评测,简单总结: 1. GPT6-Astra 在 Coding Agent能力上与Claude Opus 5、Fable 5差不多,但落后于 Fable 5.1。 综合智能指数,部分维度甚至落后于GPT5.6。 优势是Token效率高,特定任务很优秀,比如Computer Use等。 2. 评测中的Harness差异:ARC Prize的评测发现,ARC-AGI-3只有在OpenAI的特殊适配Harness上达到99%,标准跑分是63%。 以后评测都要说明是否用了专有Harness,否则容易误导。 3. 思维链监控失效:在没有Cot情况下,自主运行从3.6分钟提升到30.9分钟。 也就是说,模型不显示推理过程,能完成更复杂的任务,这也带来了潜在安全风险。 4. Astra 是OpenAI历史上最受关注的模型发布之一。 9小时3600万浏览、16.4万点赞(X上?),最近第一次超过Anthropic公司模型发布的声量。 5. 特色优势 GPT-6 Astra 主打Computer Use、自主软件编程和长流程复杂任务处理。 在 3D 建模、重建(如 Blender 与 Unreal)、数学与科学推理上取得突破,解答了 Lean 验证的未解 Erdős 问题。 6. 模型定价 标准版为百万 Tokens 输入 $10 、 百万Tokens输出 $50 2.5倍速 Fast 版为 $20 / $100,价格翻倍。 单 Token 价格比 GPT-5.6 Sol 增长 2.5 倍。 但因为 Token 效率显著提升(编程任务仅用前代约三分之一 Token),所以单任务成本只有一半。 原文见评论 💬 10 🔄 1 ❤️ 18 👀 8480 📊 12 ⚡