OpenAI 分享了两个超实用的 API 开关,GPT-5.6 Sol 在 ARC-AGI-3 上分数直接翻了三倍,token 还省了十二倍,搞推理优化的一定要看看。
OpenAI 发现 GPT-5.6 Sol 在 ARC-AGI-3 公开题库中仅得 13.3%,原因是推理过程中的私有思考被丢弃,上下文到达阈值后直接删除早期消息。通过开启 Responses API 将上一次响应 ID 传回以保留推理链,并启用 compaction 将超限上下文压缩为浓缩摘要,得分升至 38.3%。最高档每局输出 token 从 290 万降至 49 万,新程序在“高”档即达到旧程序“最高”档的分数,token 消耗相差约 12 倍。
OpenAI 只打开两个 API 设置 GPT-5.6 Sol 在 ARC-AGI-3 的分数从 13.3% 涨到 38.3% - OpenAl复盘了一次自家模型「考砸」的经历:同一个 GPT-5...
OpenAI 只打开两个 API 设置 GPT-5.6 Sol 在 ARC-AGI-3 的分数从 13.3% 涨到 38.3% - OpenAl复盘了一次自家模型「考砸」的经历:同一个 GPT-5.6 Sol、同一套评测题,只把两个 API设置打开,ARC-AGI-3公开题库的分数从13.3% 涨到 38.3%。 - 问题出在跑模型那套程序(业内叫 harness)上:每走完一步,模型写给自己看的私有思考被整段丢掉,下一步只能从零重新理解这个游戏。 - 第二个问题是上下文塞满就删掉最早的消息,连过去按了哪些键都在被挤出去,模型等于没有「过去」。 - 修法就两个开关:用 Responses API 把上一次响应ID 传回去,推理自动留住;再开 compaction,上下文到了阈值就压成一份浓缩摘要接着跑,不删开头。 - 省钱比涨分更夸张:最高档下每局输出 token 从 290 万降到 49 万;新程序在「高」档就拿到了旧程序拼到「最高」档的同样分数,token 差约12倍。 best.xiaohu.ai/article/openai… 💬 2 🔄 2 ❤️ 6 👀 3263 📊 4 ⚡