Eric 把 Grok 4.6 当主力用了几周,实测下来最值的是那套验收标准,比改提示词管用多了。
Cursor 团队 @ericzakariasson 将 Grok 4.6 作为几周主力模型后,总结出真实工作方式变化。他让模型在供应商控制台点出 API key、对运行中应用做 QA,并用 Remotion 制作发布视频。对比测试覆盖电子表格、浏览器版帝国时代 2、MSN Messenger 等场景。他发现长 prompt 的具体性仍有用,但“work very hard”式措辞几乎不加分。模型的可自检性(如 DOM 可验证)决定上手体验,视频和 3D 更难验证。
Grok 4.6 实战经验笔记 来自 Cursor 团队 @ericzakariasson,把 Grok 4.6 当做几周日常主力模型之后,写下自己真正改了什么工作方式。 Eric 实际怎么用这款...
Grok 4.6 实战经验笔记 来自 Cursor 团队 @ericzakariasson ,把 Grok 4.6 当做几周日常主力模型之后,写下自己真正改了什么工作方式。 Eric 实际怎么用这款模型 · 用浏览器替他走网站,包括在供应商控制台里点出 API key · 对正在跑的应用做功能和视觉 QA · 把收件箱压到只剩真正需要回的几封 · 帮他起草 Cursor SDK Bridge、/rename-chat 的发布帖,并用 Remotion 做发布视频 另外专门做了几组对照,用来压测模型 “能撑到哪里”:电子表格应用、浏览器版帝国时代 2、MSN Messenger、给开源 Excalidraw 加 presentation mode、虚构季度董事会 deck、以及 X TypeScript SDK 的 60–90 秒发布片。 他最看重的两个体感 1. 信息密度。摘要里是真正的信息,不是把任务复述一遍;运行中的短更新够他判断要不要打断。小改动时它会安静,一旦开始动很多文件才会开始叙述。作者说这个“何时说话、何时闭嘴”的分寸,调起来比想象中费劲,而且现在仍会说一些他不需要的话。 2. 速度加上更聪明。4.5 已经快。4.6 是快,而且明显更聪明。这个组合改变了节奏:异步能在他不在时多干活,但回来要冷启动看一份大 diff;4.6 把他拉回同步。他写得很清楚——当他在乎结果时,他更愿意待在同步里。 最高杠杆不是提示词写法,是验收标准 他专门对比过提示风格:长 vs 短,以及 “work very hard” 这类措辞。结论分三层: 1. 措辞几乎没用。 “努力工作、一直做到完”这类话,对 4.6 基本加不上分。它自己就会撑相当一段时间。 2. 长度有用,但不是因为更长就更好。 长 prompt 买的是具体性:你已经知道要什么,就写下来。短 prompt 把更多决定交给模型的品味。以前这个交易通常偏向把一切写死;4.6 的品味已经好到:短 prompt 加一条清楚偏好,通常就能落到不错的地方。 长规格仍然有效——他给过一份带 session capture、server handler、cloud agent dispatch 的 feedback widget 规格,模型能从头跟到尾,结构也合理;只是组件会重复,除非你明确要求拆开。 3. 真正拉开结果的,是一句验收指令。 全文最重要的抽象:可自检性 需要他上手去带的地方,几乎都收束到一件事:模型有多容易验证自己的工作。 · 网站最好验。 DOM 是文本,可以读页面、截图、对照意图。所以 UI 上的验证环特别有效。 · 3D 更难。 多了一个读不出来的维度。 · 视频更难。 时间是额外维度,检查意味着截一串帧、推理帧与帧之间的差。 · 物理同类。 模型对世界“应该怎样”有感觉,但单张截图回答不了“它是不是真的那样动了”。 eric zakariasson @ericzakariasson grok 4.6 is live! a write up on my learnings, findings and tips to using the model! x.com/i/article/2087… 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 0 👀 239 📊 1 ⚡