技巧多源确认79°

OpenAI 发布 GPT-6 家族实用指南:模型选择、API 缓存与 Agent 调优

精选理由

OpenAI 这份指南挺实用,教你怎么在 GPT-6 Astra、Sol、Luna 之间选模型,还有 API 缓存省 95% 的具体操作步骤,用 Codex 做 项目的朋友可以照着改改自己的配置。

OpenAI 发布 GPT-6 家族使用指南,明确了分工:GPT-6 Astra 负责最难推理任务,GPT-6.1 Sol 处理复杂编程和电脑操作,GPT-6 Luna 做信息提取和结构化摘要。指南建议模型升级后重新检查旧的提示词和 Skills,清理那些为老模型添加的限制规则。API 缓存部分给出具体步骤:固定资料放请求前面、设置显式缓存断点,可缓存前缀至少 1,024 个 Token,命中缓存的输入部分最高省 95%。GPT-6.1 Sol 还支持在 Responses API 中调度多个子 Agent,可把独立任务并行拆分,目前处于 Beta。

原文 · 岚叔

OpenAI 发了一份 GPT‑6 家族的实用指南,模型怎么选、API 怎么省钱、怎么让 Agent 把活干完,都整理了。所有链接我整理到评论区了

里面一个提醒挺有意思:模型升级了,以前攒下来的提示词和 Skills,也该翻出来检查一下了。有些为了让老模型听话加上的规则,现在可能会限制新模型发挥。

用 Codex 或者 API 做项目的朋友,可以看看。原文和相关文档放评论区,挑几个实用的说:

1️⃣ 模型和思考档位,跟着任务选

官方给的分工是:

• GPT‑6 Astra:最难的推理任务。 • GPT‑6.1 Sol:复杂编程、研究和电脑操作。 • GPT‑6 Luna:信息提取、分类、结构化摘要这类重复工作。 简单修改用低档,复杂分析再往上加。High 还解决不了,再试更高档位,看效果值不值多花的时间和钱。

2️⃣ Skills 和 AGENTS.md 可以做一次清理

Skill 的描述写短一点,把“什么时候该用”说清楚,具体资料按需加载。

比如改个错别字,也要求先把架构、数据库、部署文档全部读一遍,就挺折腾的。

还有“任何操作都先问我”这类规则,可以改得具体一些:哪些本地操作能自己继续,哪些决定需要找你确认。

尤其要写清楚,做到什么程度算完成。如果你要的是能用的产品,就把实现、运行、检查效果、修复问题都放进要求里。否则它可能写完第一版,就停下来等你验收了。

3️⃣ API 缓存,拿一个具体场景说

比如你做一个客服应用,每次都要让模型读同一份产品手册和客服规则,只是用户的问题在变。

这类场景,可以按下面几步处理:

• 先拆内容。产品手册、客服规则放在前面,用户问题放在后面。时间、订单状态这些会变化的信息,也放到后面。

• 标出缓存范围。在 API 请求里选择显式缓存,把缓存断点设在固定资料的末尾。这样就能控制写入范围,避免把每次变化的问题也写进去。

• 后续保持一致。每次请求仍然带上同样的固定资料,替换后面的用户问题。模型、工具定义和排列顺序也尽量保持稳定。

• 发两次请求验证。固定资料不变,换一个问题,看第二次返回的缓存读取 Token 数量。大于 0,才说明实际复用了缓存。

GPT‑6 这类模型,可缓存的前缀至少需要 1,024 个 Token。缓存默认开启,显式配置适合上面这种固定资料反复使用、后面内容不断变化的场景。

如果没命中,就用官方的缓存诊断功能,对比前后两次请求,检查固定内容、工具或设置哪里变了。

官方说的最高省 95%,针对命中缓存的输入部分。最后要一起看缓存读取、缓存写入和整次任务的费用,确认实际省了多少。

4️⃣ 长任务可以边做边调整,也可以分头干

API 支持执行过程中补充指令;慢工具还在运行时,模型可以先做不依赖它的工作。

GPT‑6.1 Sol 还支持在 Responses API 里调度多个子 Agent,把独立任务分出去,最后汇总,目前处于 Beta。

比如排查一个复杂问题,可以让几个 Agent 分别检查不同模块。任务拆得开,才有并行的价值;子 Agent 多了,Token 消耗也可能增加。

评论区内容

上面提到的官方原文和配置文档,整理在这里👇