事件专题 · 官方一手

OenoBench:葡萄酒领域大模型评测基准

研究团队发布OenoBench,一个包含3266道选择题的葡萄酒领域知识评测基准。该基准基于38104个原子事实构建,涵盖六个支柱和四个难度层级。评估16个前沿模型配置,发现整体准确率在53%-84%之间,o3以83.6%领先。DeepSeek R1在推理模式下提升6.8个百分点,而Claude Opus和Gemini Pro无提升。Anthropic在自身问题上偏好度+9pp,Google则-8pp。开源模型与专有推理模型共享成本-准确率帕累托前沿。所有配置在闭卷可解项目上平均提升33pp。

当前结论

研究人员搞了个叫OenoBench的葡萄酒知识测试题库,用这个题库测了16个大模型,发现o3考得最好,DeepSeek R1在推理题上表现突出,还发现模型对自己出的题有偏好,挺有意思的。

10 个信源37° AI 热度最后更新 2026/8/20 14:37:22

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情