AITP
精选全部 AI 动态AI 日报Agent 接入关于更新日志信源提报反馈
登录 / 注册
AITOP
全部 AI 动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
标签:GAIA×
6月16日
20:46
AITOP6月16日 20:46
600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI600亿美元买下Cursor,xAI终于拿到了编程工具,但真正值得跟踪的或许不是AI
6月12日
12:57
AITOP6月12日 12:57
Claude代码里藏了个20260612,18个月后的AI记忆革命已经开始倒计时
6月11日
15:28
AITOP6月11日 15:28
1107 vs 303:谷歌悄悄开源了一个“拆打字机”的模型,把大模型速度翻了4倍
15:23
AITOP6月11日 15:23
DiffusionGemma颠覆文本生成?自回归模型的“统治”要结束了
15:07
AITOP6月11日 15:07
每秒1107个token,Google开源的扩散模型为什么能改变本地推理格局?
6月9日
09:40
09:40arXiv: Anthropic@Jason Starace
精选72°
一项预注册的对照研究系统比较了三种不同 scaffold(ReAct、多智能体 Planner-Actor-Rater、Planner-then-Executor)在五个模型(Claude Opus 4.7、Sonnet 4.6、Haiku 4.5、Gemini 3.1 Pro Preview、GPT-5.5)上的 GAIA 验证集表现。研究发现,仅 scaffold 选择就使同一模型的准确率波动高达 28 个百分点,证实了 scaffold 变化至少产生 10 个百分点的差距。更令人意外的是,更强大的模型并未对 scaffold 更不敏感——在更难的 Level 2 任务中,最强模型反而从结构化 scaffold 中获益最多。多智能体设计在 Anthropic 模型家族中优于 ReAct,但跨模型提供商时优势消失。结构化 scaffold 调用工具次数更少,但在困难任务中从错误中恢复的能力更强。这些结果表明,单 scaffold 的能力评估数字是 scaffold 条件性的,且随着模型改进,评估差距未必会缩小。
论文模型评估ScaffoldGAIA智能体预注册研究

推荐理由:做 AI 模型评测或选型的人必须看——这篇研究用严格对照实验证明,你看到的模型能力分数可能更多反映的是 scaffold 设计而非模型本身,建议重新审视自己的评估流程。
原文
精选全部日报登录