主要来源arXiv: OpenAI
查看原文事件专题 · 官方一手
AI基准未测项:模态、搜索、引用及安全评估启示
一篇arXiv论文审计了ChatGPT聊天界面与OpenAI API两种访问模态在有无网页搜索下的表现,样本含401个提示、共4812次响应。结果显示,关闭搜索时聊天界面在两个基准上的准确率均低于API;启用搜索使准确率下降最多8个百分点,甚至逆转了一个基准的模态趋势。同一提示重复三次,最多21%的提示出现不一致响应。作者认为安全评估应系统纳入模态、多次运行一致性、搜索条件和引用行为等因素。
当前结论
这篇论文用真实数据告诉你,同一个模型换种方式调用,成绩能差8个百分点,跑三次还不一样,评估AI安全时别只看一个数字。
11 个信源52° AI 热度最后更新 2026/8/6 15:58:32
证据链
相关来源 1@OpenAIDevs
查看原文相关来源 2Greg Brockman
查看原文相关来源 3AWS Machine Learning Blog
查看原文相关来源 4Anthropic
查看原文相关来源 5Gary Marcus
查看原文相关来源 6IT之家
查看原文相关来源 7The Rundown AI
查看原文相关来源 8Latent.Space
查看原文相关来源 9Thomas Wolf
查看原文相关来源 10Simon Willison’s Weblog
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。