事件专题 ·多源确认

TasteVal 基准发布:量化 AI 的实验研究品味,Opus 5.5 超过人类专家

新基准 TasteVal 用 8 个开放式任务评测前沿模型的实验研究品味,即给定固定研究问题后迭代设计实验并解读结果的能力。被测模型扮演 Researcher,由固定的 Coder agent 负责实现实验,预算上限为 40 H100 小时或 120 小时。团队招募 24 名人类专家建立基线,评测了 2023 至 2026 年发布的 20 个模型。成绩最好的 Opus 5.5 超过专家基线,计算乘数为 2.3 倍(95% CI 1.15-4.37),单次运行成本约为人类基线的 1/30。数据还显示自 2025 年 12 月起,前沿模型的计算乘数约每 3.0 个月翻一倍,明显快于此前的 14 个月周期。

当前结论

这个 TasteVal 把研究品味换算成省了多少算力来打分,Opus 5.5 用 1/30 的成本跑赢人类专家,数字挺有意思的。

3 个信源88° AI 热度最后更新 2026/10/5 17:57:15

证据链

3 个信源

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。