论文精选10:23StateM 运行时实现 Terminal-Bench 2.1 95.3% 原始准确率StateM 不改模型权重,光靠升级执行系统就把 GPT-5.6 在终端测试的准确率拉到 95.3%,成本只要 15 美元,值得看看它的思路。#StateM#GPT-5.6#DeepSeek-V4#智能体aarXiv: DeepSeek@Ziheng Qin 等 4 人原文稍后读已读值得跟进有用关注 StateM