CursorBench 4.0 数据显示 Gemini 3.8 Flash 在 token 和 step 上表现突出
细看 CursorBench 4.0 数据,才发现了 “一枝独秀” 的 Gemini 3.8 Flash ... 单看 cost 和 score,平平无奇,泯然众人;不是最贵,也不是最强。 但再看...
Claude 的开发者测试数据,能帮你了解不同模型在真实场景下的表现,比如 token 和 step 的消耗情况。
CursorBench 4.0 的数据显示,在 token 和 step 指标上,Gemini 3.8 Flash 表现突出。该基准测试从真实会话中反向出题,任务规模较大且保留歧义,旨在衡量正确性、代码质量、效率等多个维度。
细看 CursorBench 4.0 数据,才发现了 “一枝独秀” 的 Gemini 3.8 Flash ... 单看 cost 和 score,平平无奇,泯然众人;不是最贵,也不是最强。 但再看...
细看 CursorBench 4.0 数据,才发现了 “一枝独秀” 的 Gemini 3.8 Flash ... 单看 cost 和 score,平平无奇,泯然众人;不是最贵,也不是最强。 但再看 token 和 step,简直遥遥领先 😂 tokenmaxxxing 和 stepmaxxxing 无疑了,像极了你那个非常努力,通宵达旦的学习,但只能考到中等;一旦放松马上掉队的同学 Your browser does not support the video tag. 🔗 View on Twitter meng shao @shao__meng SWE-bench 等公开基准被“刷爆”,Cursor 更新发布私有基准 CursorBench 4.0 · Claude Fable 5.1、Opus 5 贵但确实最强 · GPT-6 Astra 不参与评测(原因你懂) · Grok 4.6 表现不突出,和 Muse Spark 1.3 相比优势不大,且更贵 · Lee 表示 Grok 4.7 会有很大提升 cursor.com/cn/cursorbench 再看看 CursorBench 方法论:从真实会话中“反向出题” 核心机制是 Cursor Blame:将已提交的代码追溯回生成它的智能体请求,天然形成“开发者查询—标准答案”配对。配套设计包括: · 防泄漏:大量任务来自内部代码库和受控来源,且每隔数月整体更换题库; · 任务更重:从初版到 3.0,任务规模(代码行数、涉及文件数)约翻倍,明显大于 SWE-bench 各变体,并引入 monorepo 多工作区、排查生产日志、长时实验等难题; · 刻意保留歧义:任务描述保持简短、信息不充分,模拟开发者真实的表达方式,而非为方便评分而人为消除不确定性。 评测理念:线上-线下双闭环 CursorBench(线下)衡量正确性、代码质量、效率、交互行为多个维度;线上评估则在真实流量上做受控实验,专门捕捉“离线得分高、但开发者实际体验更差”的回归,这类问题是纯离线评测的盲区。 Cursor 给了一个消融实验案例:完全移除语义搜索工具后,才准确定位其价值集中在大型代码库的仓库级问答场景。 🔗 View Quoted Tweet 💬 0 🔄 1 ❤️ 1 👀 567 📊 1 ⚡