OpenAI 未对 GPT-5.6 报告自主任务基准 GDPval 结果
OpenAI 自己搞了个硬核自主任务基准 GDPval,花了大钱,结果 GPT-5.6 的成绩藏起来了。背后有啥故事?不点进来看看?
OpenAI 自己搞了个硬核自主任务基准 GDPval,花了大钱,结果 GPT-5.6 的成绩藏起来了。背后有啥故事?不点进来看看?
Ethan Mollick 发现 Claude Code 里的 Fable 很牛,但对 5 小时以上的任务没法实时干预,提醒你用它做长任务时要留个心眼。
Claude Fable 5 突破了 AI 的边界,从聊天框变成能独立干活的智能体,做自动化或大型项目的开发者值得关注,它可能改变你处理复杂任务的方式。
Qwen 3.7 Max 证明了 AI 可以稳定执行 35 小时的长任务,做自动化工作流或复杂项目管理的开发者值得关注,这可能是你寻找的可靠长任务模型。