事件专题 · 官方一手

AI基准未测项:模态、搜索、引用及安全评估启示

一篇arXiv论文审计了ChatGPT聊天界面与OpenAI API两种访问模态在有无网页搜索下的表现,样本含401个提示、共4812次响应。结果显示,关闭搜索时聊天界面在两个基准上的准确率均低于API;启用搜索使准确率下降最多8个百分点,甚至逆转了一个基准的模态趋势。同一提示重复三次,最多21%的提示出现不一致响应。作者认为安全评估应系统纳入模态、多次运行一致性、搜索条件和引用行为等因素。

当前结论

这篇论文用真实数据告诉你,同一个模型换种方式调用,成绩能差8个百分点,跑三次还不一样,评估AI安全时别只看一个数字。

11 个信源52° AI 热度最后更新 2026/8/6 15:58:32

证据链

相关来源 3AWS Machine Learning Blog
查看原文
相关来源 10Simon Willison’s Weblog
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情