Grok 4.6 发布:长程 Agent 与视觉交互增强

Grok 4.6 果然来了,老马诚不欺我,甚至很期待 Grok 4.7 现在 Grok Build, Cursor, Grok Bot 和 API 已经可用,感觉我的 Cursor Ultra 订...

精选理由

Grok 4.6 上线,长程 Agent 强化,指数追平 GPT-5.6 Sol Max,试试?

AI 摘要

Grok 4.6 已通过 Grok Build、Cursor、Grok Bot 和 API 开放。官方对比 Grok 4.5 High、GPT-5.6 Sol Max、Fable 5 Max,Artificial Analysis 综合指数 61,与 GPT-5.6 Sol Max 持平,距 Fable 5 Max 的 62 差 1 分。长程 Agent 任务提升明显:DeepSWE 从 54% 升至 65.9%,APEX-Agents 从 47.1% 升至 57.5%,Terminal-Bench 从 15.7% 升至 26%。上下文窗口 50 万 token,支持文本与图像输入、文本输出,函数调用和结构化输出。相对 4.5 的 10 项评测全升,但 APEX-SWE 仅增加 2.8 个百分点,编码能力提升不均。

原文 · shao__meng

Grok 4.6 果然来了,老马诚不欺我,甚至很期待 Grok 4.7 现在 Grok Build, Cursor, Grok Bot 和 API 已经可用,感觉我的 Cursor Ultra 订...

Grok 4.6 果然来了,老马诚不欺我,甚至很期待 Grok 4.7 现在 Grok Build, Cursor, Grok Bot 和 API 已经可用,感觉我的 Cursor Ultra 订阅含金量还在上升! Grok 4.6 在 4.5 的基础上,专门加强两件事: 1. 长程 Agent:能在多步任务里待得住——调研、分析、改代码库、把一个想法做成可用产物。 2. 更重的交互与视觉工作:给一个具体产品想法,一次性把应用结构和视觉语言立起来,再进入迭代。 Grok 团队自己的测试观察还包括:更长轨迹上出现更多自测与核验;视觉/交互项目的第一稿明显强于 4.5。 规格上,Grok 4.6 是当前最强也最快的文本模型:grok-4.6,上下文 50 万 token,文本 + 图像进、文本出,支持函数调用、结构化输出和推理。 评测:相对自己是代际跃迁,相对 SOTA 是进入梯队 官方用 Grok 4.6 High 对比 Grok 4.5 High、GPT-5.6 Sol Max、Fable 5 Max。Artificial Analysis 综合指数上,4.6 得 61,与 GPT-5.6 Sol Max 持平,比 4.5 的 56 高 5 分,距 Fable 5 Max 的 62 只差 1 分。 相对 4.5,10 项全升。涨得最狠的是需要真正动手的任务:DeepSWE 54% → 65.9%,APEX-Agents 47.1% → 57.5%,Terminal-Bench 15.7% → 26%。知识工作 Elo 同样跳得很明显:GDPVal-AA 1526 → 1753,AA-Briefcase 1313 → 1577。编码相关里,APEX-SWE 只加了 2.8 个百分点,说明“写软件”这条线的提升并不均匀。 SpaceXAI @SpaceXAI Introducing Grok 4.6. It delivers frontier intelligence and is a significant improvement over Grok 4.5 at the same price. 🔗 View Quoted Tweet 💬 2 🔄 0 ❤️ 0 👀 365 📊 2 ⚡

Grok 4.6 发布:长程 Agent 与视觉交互增强 · AI 热点