09:58官方一手arXiv: OpenAI@Abraham Camelo-Guerrero, Jairo Diaz-Rodriguez研究者让OpenAI GPT-5.4、Google Gemini 3.1 Pro Preview和Anthropic Claude Opus 4.6评审300篇ICLR 2026投稿(oral、poster、rejected各100篇),与人类评审和最终决定比较。三个模型都能区分被接收和拒稿的论文,但都无法复现人类评分中oral与poster的区分。Gemini给出的分数系统性偏高,OpenAI和Claude对被拒和poster论文更接近人类,但对oral论文更苛刻。人类评审更常提出计算效率问题,LLM则更常指出缺少基线对比。论文GPT-5.4Gemini 3.1 ProClaude Opus 4.610 个信源在谈事件专题推荐理由:让GPT-5.4、Gemini 3.1和Claude 4.6评审300篇ICLR论文,发现它们能区分录用和拒稿,但分不清oral和poster,Gemini给分偏高。用AI审稿前先看看这个。原文稍后读已读值得跟进有用关注 GPT-5.4
16:44Stanford AI Lab@StanfordAILab斯坦福AI Lab在ICLR 2026上公布了其论文列表,涵盖LLM推理、智能体系统、AI安全、机器人、空间智能、视频生成等多个前沿方向。这些论文代表了该实验室在AI领域的最新研究成果,对学术界和工业界均有重要参考价值。参会者可以现场交流,未参会者也可在线查看论文详情。论文ICLR 2026斯坦福AI LabLLM推理推荐理由:斯坦福AI Lab的论文列表是了解AI前沿趋势的绝佳窗口,做LLM推理、智能体或AI安全的研究者值得点开看看,说不定能找到灵感或合作方向。原文稍后读已读值得跟进有用关注 ICLR 2026
10:07官方一手arXiv: OpenAI@Yashwardhan Chaudhuri, Sanyam Jain, Paridhi Mundra精选E3是一个自动化的论文评审助手,旨在帮助审稿人和工程团队识别论文中的技术问题。它能够报告问题的性质、位置、对贡献的影响以及解决所需的证据,涵盖未支持的声明、缺失的消融实验、弱基线、隐藏假设、有效性威胁和数据泄露风险。为了无污染地评估E3,研究采用了issue级回测协议:只使用训练截止日期后的论文,并由一个观察匿名评审的元法官标记每个问题来源对为“捕获”、“部分”或“遗漏”。在100篇ICLR 2026论文和4598个问题行的测试中,E3在所有聚合指标上实现了最高召回率,部分包含召回率达90.2%,比GPT高15.5个百分点,比Claude高17.1个百分点,比人类评审高29.2个百分点。E3还恢复了人类评审提出的89.6%的问题,并额外发现了1635个被人类遗漏的问题。论文论文评审自动化评估回测协议推荐理由:E3解决了论文评审中遗漏关键技术问题的痛点,做学术评审或论文质量控制的团队可以直接用这套开源工具提升效率,建议点开看看具体实现。原文稍后读已读值得跟进有用关注 论文评审
13:36官方账号EleutherAI@AiEleutherEleutherAI 团队在 ICLR 2026 会议上组织线下聚会,成员包括 @BlancheMinerva、@GoncaloSPaulo、@norabelrose 等。参会者可通过 Discord 的 #general > ICLR 2026 Meetup 线程协调会面。这为关注开源 AI 研究的社区成员提供了面对面交流的机会。行业EleutherAIICLR 2026线下聚会推荐理由:如果你关注开源 AI 研究或 EleutherAI 的工作,ICLR 2026 的聚会是直接与核心成员交流的好机会,建议参会者加入 Discord 线程协调。原文稍后读已读值得跟进有用关注 EleutherAI