03:06Paul Couvert@itsPaulAiOffloop团队推出D1层,一个仅3B参数的多智能体路由层。它在GDPval基准上达到SOTA,领先Claude Code和Codex,覆盖美国年收入2.4万亿美元的岗位需求。D1自动决定每个步骤由哪个智能体执行,替代手动比较多个agent输出。AI模型OffloopD1GDPval3 个信源在谈事件专题推荐理由:Offloop搞了个D1路由层,3B参数就能自动调度多个AI agent,基准上干掉了Claude Code和Codex,挺有意思。原文稍后读已读值得跟进有用关注 Offloop
02:10elvis@omarsar0多智能体系统面临智能体重复工作、互相通信浪费token的难题。Offloop团队训练了一个名为D1的调度器模型,它能决定哪个智能体下一步行动,并在合适时保持静默。该方法在GDPval基准上达到了SOTA性能,同时大幅降低了成本。用户还可以自带自己的AI订阅。AI模型OffloopD1GDPval3 个信源在谈事件专题推荐理由:Offloop用D1调度器解决了多智能体互相重复工作的老问题,成本低还让你用自己订阅的AI。原文稍后读已读值得跟进有用关注 Offloop
12:31Ethan Mollick@emollickOpenAI 为新模型 GPT-5.6 开发了高质量自主任务基准 GDPval,但未公开该基准的测试结果。该基准旨在评估模型在困难任务上的自主能力,开发成本高昂。外部评论者指出 OpenAI 在指标讨论中回避关键数据,引发透明性质疑。AI模型GPT-5.6OpenAIGDPval10 个信源在谈事件专题推荐理由:OpenAI 自己搞了个硬核自主任务基准 GDPval,花了大钱,结果 GPT-5.6 的成绩藏起来了。背后有啥故事?不点进来看看?原文稍后读已读值得跟进有用关注 GPT-5.6
13:25官方账号Logan Kilpatrick@OfficialLoganK88°Google 的 Gemini 3.5 Flash 模型在 GDPval 基准测试中相比 3.1 Pro 取得了显著进步,性能已接近前沿水平。这表明后训练(post-training)技术仍在持续提升模型能力。该消息由开发者 Logan Kilpatrick 在 X 上分享,引发社区关注。Gemini 3.5 Flash 作为轻量级模型,其竞争力提升对开发者选择高效模型具有参考价值。AI模型Gemini 3.5 FlashGDPval后训练推荐理由:轻量模型逼近前沿,做推理或成本敏感应用的开发者值得关注——Flash 系列可能成为性价比新选择。原文稍后读已读值得跟进有用关注 Gemini 3.5 Flash