09:58官方一手arXiv: OpenAI@Abraham Camelo-Guerrero, Jairo Diaz-Rodriguez研究者让OpenAI GPT-5.4、Google Gemini 3.1 Pro Preview和Anthropic Claude Opus 4.6评审300篇ICLR 2026投稿(oral、poster、rejected各100篇),与人类评审和最终决定比较。三个模型都能区分被接收和拒稿的论文,但都无法复现人类评分中oral与poster的区分。Gemini给出的分数系统性偏高,OpenAI和Claude对被拒和poster论文更接近人类,但对oral论文更苛刻。人类评审更常提出计算效率问题,LLM则更常指出缺少基线对比。论文GPT-5.4Gemini 3.1 ProClaude Opus 4.610 个信源在谈事件专题推荐理由:让GPT-5.4、Gemini 3.1和Claude 4.6评审300篇ICLR论文,发现它们能区分录用和拒稿,但分不清oral和poster,Gemini给分偏高。用AI审稿前先看看这个。原文稍后读已读值得跟进有用关注 GPT-5.4
12:48官方账号John Schulman@johnschulman2OpenAI 联合创始人 John Schulman 宣布担任 AI 科学分析平台(链接未公开)的顾问。该平台利用 AI 帮助作者和审稿人进行比人类单独完成更深入、更彻底的分析。Schulman 认为这是 AI 在科学领域非常积极的发展方向。此举可能推动 AI 在学术评审和科研协作中的实际应用。AI产品AI 科学分析论文评审John Schulman10 个信源在谈事件专题推荐理由:AI 在科研评审中的落地案例来了——做学术写作或论文评审的团队值得关注,Schulman 的背书意味着这个方向有实质进展。原文稍后读已读值得跟进有用关注 AI 科学分析
10:07官方一手arXiv: OpenAI@Yashwardhan Chaudhuri, Sanyam Jain, Paridhi Mundra精选E3是一个自动化的论文评审助手,旨在帮助审稿人和工程团队识别论文中的技术问题。它能够报告问题的性质、位置、对贡献的影响以及解决所需的证据,涵盖未支持的声明、缺失的消融实验、弱基线、隐藏假设、有效性威胁和数据泄露风险。为了无污染地评估E3,研究采用了issue级回测协议:只使用训练截止日期后的论文,并由一个观察匿名评审的元法官标记每个问题来源对为“捕获”、“部分”或“遗漏”。在100篇ICLR 2026论文和4598个问题行的测试中,E3在所有聚合指标上实现了最高召回率,部分包含召回率达90.2%,比GPT高15.5个百分点,比Claude高17.1个百分点,比人类评审高29.2个百分点。E3还恢复了人类评审提出的89.6%的问题,并额外发现了1635个被人类遗漏的问题。论文论文评审自动化评估回测协议推荐理由:E3解决了论文评审中遗漏关键技术问题的痛点,做学术评审或论文质量控制的团队可以直接用这套开源工具提升效率,建议点开看看具体实现。原文稍后读已读值得跟进有用关注 论文评审