7月10日
7月9日
12:31
12:31Ethan Mollick@emollick
OpenAI 为新模型 GPT-5.6 开发了高质量自主任务基准 GDPval,但未公开该基准的测试结果。该基准旨在评估模型在困难任务上的自主能力,开发成本高昂。外部评论者指出 OpenAI 在指标讨论中回避关键数据,引发透明性质疑。
事件专题

推荐理由:OpenAI 自己搞了个硬核自主任务基准 GDPval,花了大钱,结果 GPT-5.6 的成绩藏起来了。背后有啥故事?不点进来看看?