10:23官方一手arXiv: DeepSeek@Ziheng Qin, Yaxin Lu, Zhangyang Atlas Wang, Kai Wang精选StateM 是一个不修改模型权重的 agent 运行时,通过状态管理和可恢复流程提升执行系统。在 Terminal-Bench 2.1 上,StateM 将 GPT-5.5 xhigh 从 83.1% 提到 92.1%,GPT-5.6 Sol xhigh 达到 95.3% 原始准确率,覆盖 445 次试验和全部 89 个任务。同一套 runbook 让 GPT-5.6 Luna 从 76.7% 升至 85.4%,超过 Sol xhigh 参考值 84.9%。用不到 38 美元的适配,DeepSeek-V4 Flash 从 82.7% 提高到 88.1%,在 88 任务核心集上到 89.1%,最终 API 花费约 15 美元,对比 GPT 参考的 574.68 美元。代码已开源在 github.com/henryqin1997/statem。论文StateMGPT-5.6DeepSeek-V4推荐理由:StateM 不改模型权重,光靠升级执行系统就把 GPT-5.6 在终端测试的准确率拉到 95.3%,成本只要 15 美元,值得看看它的思路。原文稍后读已读值得跟进有用关注 StateM
17:57shao__meng@shao__mengDeepSeek 静默发布新模型 V4-Pro-0813,官方 X 账号未官宣。Cline 团队实测其在 Terminal-Bench 2.1 上得分 87.9,仅比 Claude Fable 5 低 0.1 分。该模型价格约为 Fable 5 的 1/57,参数规模 1.6T,激活参数 49B,上下文窗口 1M。模型已上线 ClinePass,Cline 称其为当前市场性价比最高的模型。AI模型DeepSeek-V4-Pro-0813Claude Fable 5Terminal-Bench1 个信源在谈事件专题推荐理由:DeepSeek 新模型跑分只比 Claude Fable 5 低 0.1,价格却便宜 57 倍,Cline 用户现在就能用,高性价比首选。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Pro-0813
12:32官方账号arXiv cs.LG@Fanzhe Meng, Guoxin Chen, Jiale Zhao, Shuang Sun, Zhiyu Lin, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai JiaCalibForge 是一种自动终端任务合成系统,利用验证过的求解器行为,通过对抗性求解器校准来修订候选任务。多求解器校准针对异构求解器池的分歧,对比求解器校准则针对强通过/弱失败关系。该系统构建了5,431个校准终端任务。在Terminal-Bench 2.0上,基于完整集合训练的模型达到32.58%和47.57%的成绩。相比基础模型,最大提升分别达24.71个百分点(Terminal-Bench 2.0)、27.68个百分点(SWE-bench Pro)和30.04个百分点(Doc2Repo)。论文CalibForgeTerminal-BenchSWE-bench推荐理由:想给智能体造训练任务?CalibForge 让多个求解器互相挑毛病来调任务难度,比人工标靠谱,Terminal-Bench 上能涨二十多个点。原文稍后读已读值得跟进有用关注 CalibForge
12:15shao__meng@shao__meng精选Cline 团队让 Kimi K3 模型对自身运行的 Cline harness 框架进行递归式自我改进。连续运行 17 小时后,Terminal-Bench 2.1 基准从 77.5% 提升至 88.8%,同时运行成本从 $79 降至 $49.8。实验通过分析失败日志、形成假设、修复再验证的闭环迭代实现性能优化。AI模型Kimi K3ClineTerminal-Bench10 个信源在谈事件专题推荐理由:Cline 让 Kimi K3 自己优化自己,17 小时让基准从 77.5% 涨到 88.8%,成本还降了 37%,这波自举操作有点意思。原文稍后读已读值得跟进有用关注 Kimi K3
17:06Thomas Wolf@Thom_WolfPoolside AI 发布最新 agentic coding 模型 Laguna S 2.1。在 Terminal-Bench 2.1 上得分 70.2,与 5-25 倍大小的模型并列甚至领先。在 DeepSWE 基准上得分 40.4,超越部分超 1T 参数的开源模型。该模型可在单个 DGX Spark 或 Mac 上本地运行。AI模型LagunaPoolsideTerminal-Bench8 个信源在谈事件专题推荐理由:Poolside 又出了个厉害编码模型,Laguna S 2.1 在本地就能跑,多项基准比大它几十倍的模型还强。原文稍后读已读值得跟进有用关注 Laguna
09:57官方账号arXiv cs.AI@Yifan Wu, Lizhu Zhang, Yuhang Zhou, Mingyi Wang, Bo Peng, Serena Li, Xiangjun Fan, Zhuokai Zhao研究提出行为状态衰减概念,指长时任务中决策相关信息被淹没在轨迹中。一个独立的记忆智能体与行动智能体并行运行,更新结构化的记忆库并选择性注入提醒。在Terminal-Bench 2.0和τ²-Bench上,该方法将pass@1分别提升8.3和6.8个百分点。消融实验表明选择性干预优于被动暴露或持续注入。作为开放权重记忆策略的初步工作,在SETA上使用SFT和GRPO训练Qwen3.5-27B,提升验证奖励并部分迁移到Terminal-Bench。论文Proactive Memory AgentTerminal-Benchτ²-Bench推荐理由:长时任务里AI老忘事?这篇提出主动记忆智能体,随跑随记关键信息,在Terminal-Bench上提升8.3pp,比被动记忆好用多了。原文稍后读已读值得跟进有用关注 Proactive Memory Agent
06:48Suhail@SuhailSuhail 指出未来12个月“每任务成本”将是更有意义的指标。Alex Atallah 以 Terminal-Bench 为例,用 Claude Haiku 和 Opus 运行15个任务子集,结果显示 Haiku 成本是 Opus 的10倍,说明价格/代币不等于成本/任务。这提醒开发者关注实际任务开销而非单价。行业HaikuOpus成本衡量推荐理由:别只看 token 单价了,朋友。同样跑15个任务,Haiku 比 Opus 贵10倍。这提醒我们,算成本要看任务总花费。原文稍后读已读值得跟进有用关注 Haiku
23:37berryxia@berryxiaOrnith-1.0 模型家族覆盖 9B 到 397B MoE 全尺寸。在 Terminal-Bench、SWE-Bench 等 agent coding 基准上达到当前开源模型顶尖水平。其训练方式使用 RL 同时优化任务脚手架和最终解决方案。模型全系列 MIT 开源,并提供了 GGUF 版本,可在 Ollama、Unsloth 等工具中直接运行。AI模型Ornith-1.0Terminal-BenchSWE-Bench推荐理由:Ornith-1.0 用 RL 教模型搭执行框架,在 SWE-Bench 上表现顶尖,本地党还有 GGUF 版本可玩。原文稍后读已读值得跟进有用关注 Ornith-1.0
08:00Thomas Wolf@Thom_Wolf精选Terminal-Bench 是一个评估 AI 模型在计算机上使用工具(如命令行)达成目标能力的基准。现在它扩展到了科学领域,推出 T-Bench Science,专门评估 AI 在真实科研工作流中的表现。该基准面向生命科学、物理、地球科学、数学等领域的科学家,并开放任务贡献至 2026 年 8 月。贡献的科研工作流越多样,越能推动下一代 AI 模型更好地辅助日常研究工作。这不是训练数据集,而是用于评估前沿模型性能的基准。Anthropic、OpenAI 和 Google DeepMind 已使用 Terminal-Bench 评估 AI 编程能力,现在科学领域也加入其中。AI产品基准测试AI for ScienceTerminal-Bench10 个信源在谈事件专题推荐理由:做科研的 AI 用户终于有了专门评估 AI 辅助科研能力的基准——T-Bench Science 直接面向真实工作流,科学家可以贡献自己的流程来推动模型进步,值得关注和参与。原文稍后读已读值得跟进有用关注 基准测试
01:10shao__meng@shao__meng精选73°Cline 团队发布了 Cline SDK,同时推出基于 SDK 的 Cline CLI 和 Skills。Cline 是最早的 Agentic Coding 工具之一,此前以 IDE 插件形式存在,技术实力强,工程团队多人曾加入 Codex。最新 Cline CLI 在 Terminal-Bench 2.0 上多项第一,超越 Claude Code、Codex 和 Droid 等 Agent。Cline 2.0 重写了 prompts、简化 loop、收紧上下文管理、改进反馈与错误处理,并重新设计工具暴露方式。在开源权重模型上领先更明显,如 kimi-k2.6 达 55.1% vs OpenCode 37.1%。新能力包括 Plugin 层、Provider 开放性、原生 Agent Teams、开箱即用的 CRON/checkpointing/Web search/MCP connector,以及实验性的 CLI Connectors 可接入 Telegram/WhatsApp/Slack。AI产品Agentic CodingClineCLI3 个信源在谈事件专题推荐理由:Cline SDK 和 CLI 的发布让 Agentic Coding 工具链更开放灵活,做 AI 编程工具或 Agent 开发的团队可以直接用 Plugin 层和 Provider 扩展,值得关注其 Terminal-Bench 成绩和 Harness 实践。原文稍后读已读值得跟进有用关注 Agentic Coding