Artificial Analysis 的模型榜单要更新了,v5 加入 Terminal-Bench Science 和私有数据集的编程测试,看榜单选模型的朋友可以蹲一下。
#Terminal-Bench
训练终端智能体的朋友看这篇:监督窗口选 12K 反而比 16K 好,还能省 30% 训练时间,作者给的选择性精调方法直接可用。
DeepSeek V4 Flash 加自改 harness,花 4 美元搜索就在 Terminal-Bench 上追平 Codex,SWE-bench 还省了近四成开销,做智能体的都该看看。
微软这篇论文讲怎么优化 agent 的 harness,核心是把预算花在还没修好的失败上。GAIA2 提了 4.4 个点,成本还降到四分之一,做 agent 自动调优的可以看看。
Anthropic 推出 Sonnet 5.5,价格不变但性能大增,成本降三成,速度提三成,特别适合编程和文档工作。
把技能文档变成 2756 个训练环境直接练进模型权重,微调后的 Qwen3.5-35B-A3B 在终端基准上超过了 Claude Sonnet 4.6,思路很新颖。
一个开源科研智能体把 Codex 和 Claude Code 都比下去了,Apache 2.0 免费随便用,还能接自家模型。
有人把 Opus 5.5 和 GPT 6 的跑分放在一张图里了,重点看 Terminal-Bench 4.0,GPT 在跨应用自动化那项表现很猛。
Claude Code 团队成员自己写的 effort 档位指南,有实测数据:同一道题 low 档只过 1 次、xhigh 全过,还教了一套 low 起手、high 收尾的开发流程。
Claude Code 开发者用 Terminal-Bench 3.0 数据讲清了 effort 档位怎么选,还附了低档写代码、高档跑验证的工作流,写代码的人直接能用。
Zed 家的 Delta 跑分追平甚至超过了 Codex 和 Claude Code,成本差不多,写代码的可以关注下这个新选择。
Stanford 联合 Terminal-Bench 团队搞了个科研智能体榜单,70 个真实科研任务里 GPT-6 Astra 拿 63% 排第一,开源模型才 10%,差距很直观。
Salesforce 这篇论文发现公开 RL 环境大多有奖励错误,还给出 RIVER 筛选方法,8B 模型跑分反超随机采样,做 RL 训练的都该看看。
一篇很实用的论文:不改模型、不改提示词,只在运行时注入失败 informed 的策略指令,GPT-5.6 跑 Terminal-Bench 的重复成功率就能涨近 10 个点,做 Agent 的可以看看。
Anthropic 新模型追平自家顶级模型,价格还砍了四成,缓存读取降到 0.2 美元,跑 Agent 的开发者直接受益,比 GPT-6 Astra 便宜一半以上。
StateM 不改模型权重,光靠升级执行系统就把 GPT-5.6 在终端测试的准确率拉到 95.3%,成本只要 15 美元,值得看看它的思路。
DeepSeek 新模型跑分只比 Claude Fable 5 低 0.1,价格却便宜 57 倍,Cline 用户现在就能用,高性价比首选。
想给智能体造训练任务?CalibForge 让多个求解器互相挑毛病来调任务难度,比人工标靠谱,Terminal-Bench 上能涨二十多个点。
Cline 让 Kimi K3 自己优化自己,17 小时让基准从 77.5% 涨到 88.8%,成本还降了 37%,这波自举操作有点意思。
长时任务里AI老忘事?这篇提出主动记忆智能体,随跑随记关键信息,在Terminal-Bench上提升8.3pp,比被动记忆好用多了。
做科研的 AI 用户终于有了专门评估 AI 辅助科研能力的基准——T-Bench Science 直接面向真实工作流,科学家可以贡献自己的流程来推动模型进步,值得关注和参与。
Cline SDK 和 CLI 的发布让 Agentic Coding 工具链更开放灵活,做 AI 编程工具或 Agent 开发的团队可以直接用 Plugin 层和 Provider 扩展,值得关注其 Terminal-Bench 成绩和 Harness 实践。