10:23官方一手arXiv: DeepSeek@Ziheng Qin, Yaxin Lu, Zhangyang Atlas Wang, Kai Wang精选StateM 是一个不修改模型权重的 agent 运行时,通过状态管理和可恢复流程提升执行系统。在 Terminal-Bench 2.1 上,StateM 将 GPT-5.5 xhigh 从 83.1% 提到 92.1%,GPT-5.6 Sol xhigh 达到 95.3% 原始准确率,覆盖 445 次试验和全部 89 个任务。同一套 runbook 让 GPT-5.6 Luna 从 76.7% 升至 85.4%,超过 Sol xhigh 参考值 84.9%。用不到 38 美元的适配,DeepSeek-V4 Flash 从 82.7% 提高到 88.1%,在 88 任务核心集上到 89.1%,最终 API 花费约 15 美元,对比 GPT 参考的 574.68 美元。代码已开源在 github.com/henryqin1997/statem。论文StateMGPT-5.6DeepSeek-V4推荐理由:StateM 不改模型权重,光靠升级执行系统就把 GPT-5.6 在终端测试的准确率拉到 95.3%,成本只要 15 美元,值得看看它的思路。原文稍后读已读值得跟进有用关注 StateM