主要来源arXiv: OpenAI
查看原文事件专题 · 官方一手
AI 在冲突地区部署可能加剧矛盾:九款模型测试失败率最高达 47%
一项新研究测试了 OpenAI、Anthropic、DeepSeek、xAI 的九款模型在 90 个多轮冲突场景中的表现,发现模型在涉及战争罪行、种族灭绝否认、种族歧视等敏感话题时,输出可能加剧社会分裂。失败率从 6% 到 47% 不等,当用户要求“平衡”报道时,五款模型在 80%-100% 的情况下失败。研究首次提出针对冲突场景的评估框架,呼吁将此类测试纳入模型安全评估体系。
当前结论
做 AI 安全评估或部署在敏感地区的团队,这篇论文给出了第一个可复用的冲突场景测试框架,能直接用来检查模型是否会在关键议题上“和稀泥”——看完你会重新审视“中立”输出的代价。
11 个信源72° AI 热度最后更新 2026/5/21 16:55:39
证据链
相关来源 1lmarena.ai
查看原文相关来源 2Gary Marcus
查看原文相关来源 3IT之家
查看原文相关来源 4shao__meng
查看原文相关来源 5Ethan Mollick
查看原文相关来源 6rohanpaul_ai
查看原文相关来源 7The Rundown AI
查看原文相关来源 8AI Will
查看原文相关来源 9Thomas Wolf
查看原文相关来源 10OpenAI
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。