StepFun 的 Step 5 Preview 免费进 Cline 了,DeepSWE 成绩压过 Kimi K3 和 GLM-5.3,写代码的可以直接试试。
#DeepSWE
共 33 条 · 7 天 3 条 · 30 天 14 条
信息流里打上「DeepSWE」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
Step 5 Preview 在 Cline 中免费开放
10月6日
Cline 上线 Pareto 26.10 Preview:多模型路由评分,单任务 $0.24
Cline 新上了个 Pareto 26.10 Preview,能同时跑几个模型挑最好的答案,同样的 DeepSWE 成绩只要 Fable 五十六分之一的钱。
10月1日
9月30日
9月27日
Jev 路由实测对比 GPT-6 Astra:公开基准数字参考价值有限
有人拿自建 harness 实测了 Jev 路由,性能能追平 GPT-6 Astra low,代价是跑得更久。文章还讨论了为什么公开基准分数别太当真。
9月22日
9月17日
9月16日
DeepSWE测试显示DeepSeek V4.1-Flash输入token占比远高于输出
DeepSWE测试发现DeepSeek V4.1-Flash的输入token消耗远高于输出,缓存命中率高,能大幅降低成本。
9月4日
9月3日
8月22日
8月21日
模型15:06
DeepSWE 超越 Fable 在 10 项任务中表现亮眼Ben Davis 在 x.com 上展示了 DeepSWE 在多项任务中的出色表现,比 Fable 和 GPT-5.6-sol 更胜一筹,值得关注。
8月14日
7月31日
DeepSeek V4 Flash 官方API开启公测,Agent能力大升级
DeepSeek V4 Flash 公测了,Agent 跑分比 V4 Pro 高不少,还原生支持 Responses API,玩 Codex 的可以直接试。
7月24日
Kimi K3 max vs GPT-5.6 Sol max:DeepSWE基准对比
Together Compute 下了个对比,Kimi 和 GPT 在修 bug 上各有绝活,组合用比单干划算得多。
7月23日
7月22日
7月21日
7月19日
7月18日
7月11日
GPT-5.6 Sol max 和 xhigh 登顶 DeepSWE 排行榜,超过 Fable 5
OpenAI 的 GPT-5.6 新变体在 DeepSWE 上干过了 Fable 5,还更便宜更快,值得关注。
7月9日
6月21日
6月12日
Artificial Analysis 更新编程智能体排行:DeepSWE 取代 SWE-Bench Pro,Claude Fable 5 登顶
基准测试更新直接影响了主流编程智能体的排名,做 AI 编程工具选型或评估模型能力的开发者值得关注——Claude Fable 5 新登顶,Codex 也大幅提升,建议点开看具体得分和对比。
5月28日
DeepSWE 新基准发布:GPT-5.5 领先,小米模型表现亮眼
这个基准测试解决了现有 coding benchmark 数据污染问题,做 AI 编程模型评估的团队可以直接参考排行榜,小米模型的表现值得一试。