08:40官方账号OpenAI@OpenAI精选OpenAI 表示评估很少孤立测量模型,而是包含 API 设置、评估设计和提示等隐性因素。建议开发者使用 OpenAI 产品中的相同设置:使用 Responses API 而非旧版 Chat Completions API,保留推理(Retain reasoning),并启用压缩(Use compaction)。这些选择会显著影响模型输出表现。开发者可前往 arcprize.org/tasks 参与公开测试。技巧OpenAIResponses APIChat Completions API1 个信源在谈事件专题推荐理由:想用好 API 的别光看模型分数,OpenAI 告诉你设置和提示更重要,直接抄他们的作业就行。原文稍后读已读值得跟进有用关注 OpenAI
08:38官方账号OpenAI@OpenAIGPT-5.6 Sol 成功解决了数学中的开放问题,但在 ARC-AGI-3 2D 拼图基准测试中表现挣扎。调查发现,问题出在 API 的 harness 不允许模型记住之前学到的内容。启用两个 API 设置后,分数提高了 3 倍,同时输出 token 减少了 6 倍。技巧GPT-5.6 SolOpenAIARC-AGI-37 个信源在谈事件专题推荐理由:OpenAI 发现 GPT-5.6 Sol 在 ARC-AGI-3 上表现差是因为 API 设置没开对。改两个参数分数涨三倍,token 省六倍,学起来很实用。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol