主要来源arXiv: OpenAI
查看原文事件专题 · 官方一手
LLM评审与人类同行评审对齐程度如何
研究者让OpenAI GPT-5.4、Google Gemini 3.1 Pro Preview和Anthropic Claude Opus 4.6评审300篇ICLR 2026投稿(oral、poster、rejected各100篇),与人类评审和最终决定比较。三个模型都能区分被接收和拒稿的论文,但都无法复现人类评分中oral与poster的区分。Gemini给出的分数系统性偏高,OpenAI和Claude对被拒和poster论文更接近人类,但对oral论文更苛刻。人类评审更常提出计算效率问题,LLM则更常指出缺少基线对比。
当前结论
让GPT-5.4、Gemini 3.1和Claude 4.6评审300篇ICLR论文,发现它们能区分录用和拒稿,但分不清oral和poster,Gemini给分偏高。用AI审稿前先看看这个。
11 个信源62° AI 热度最后更新 2026/8/4 13:39:36
证据链
相关来源 1IT之家
查看原文相关来源 2向阳乔木
查看原文相关来源 3pandaily
查看原文相关来源 4Decoder
查看原文相关来源 5Anthropic
查看原文相关来源 6Simon Willison’s Weblog
查看原文相关来源 7The Rundown AI
查看原文相关来源 8lmarena.ai
查看原文相关来源 9小互
查看原文相关来源 10OpenAI
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。