8月24日
09:51
09:51官方账号arXiv cs.AI@Dimitri Staufer, David Hartmann, Ibrahim Baroud
研究人员提出PUN协议,用于构建和验证未知姓名,以评估LLM在事实性、隐私泄露、偏见和弃权方面的表现。研究发现,接受的名字更符合姓名特征,而参与者仅3%的情况下能恢复个人信息。发布300个姓名及对比控制名单。
推荐理由:想了解如何评估LLM在隐私和偏见方面的表现?这篇论文提出了一个新方法,值得一读。
8月7日
22:09
22:09官方账号LangChain@LangChainAI
精选71°
monday.com 工程总监 Dor Cohen 将在 10 月 13 日的 Interrupt 伦敦大会上分享 LLM 评估系统搭建经验。该系统采用双管道架构,利用 LangSmith 生产追踪数据同时支撑线上与离线评估。大会由 LangChain 主办,更多议程见 interrupt.langchain.com/london。

推荐理由:想学 LLM 评估的别错过,Dor Cohen 会讲 monday.com 怎么用 LangSmith 同时跑线上和离线评测,10 月 13 日伦敦见。
7月17日
11:24
11:24官方一手arXiv: DeepSeek@Filippos Vlahos, Guillaume Bied, Tijl De Bie
一项大规模政治偏见研究分析了1394对政府官员条目,使用Grok、Claude、Mistral和DeepSeek四个LLM裁判评估Grokipedia与Wikipedia的中立性。结果显示所有LLM裁判均认为Grokipedia中立性低于Wikipedia。Grokipedia明显偏向经济右翼政治家,而Wikipedia则偏向社会自由派。研究表明LLM撰写的百科并未实现更高中立性,反而嵌入不同意识形态。
推荐理由:这篇论文用四个LLM当裁判,比较了Grok写的百科和维基百科的政治中立性,结果发现Grok版也不中立,甚至更偏,还各有倾向。
7月7日
12:09
12:09官方一手arXiv: OpenAI@Nicole Sonne Heckmann, Arnault-Quentin Vermillet, Søren Norlin Mølgaard, Manuela Del Castillo Suero, Lars Melskens, Gerard Ompad, Maurizio Sessa
该研究开发了一种高斯过程兼容的优化目标(EWACS),用于提升LLM在药物警戒因果关系评估中的表现。在723份FAERS病例上,GPT-5.2在Naranjo算法问题5和10上分别达到74.1%和65.4%的专家一致性。贝叶斯优化后,因果分类一致性从45.0%提升至72.0%,其中Doubtful病例提升最大(+42.9个百分点)。结果表明,温度优化虽无普遍最优值,但可针对特定病例带来显著改善。
推荐理由:这篇论文用GPT-5.2做药物副作用评估,温度调优后准确率从45%跳到72%,对药物安全分析很有参考价值。
6月26日
6月12日
6月11日
6月2日
5月29日
5月28日
5月26日
12:21
12:21官方账号arXiv cs.LG@Matt L. Wiemann, Lindsay M. Smith, Peter Melchior, Siddharth Mishra-Sharma, Andrew Gordon Wilson, Pavel Izmailov, Carolina Cuesta-Lázaro
精选72°
研究人员推出了DiscoverPhysics基准,通过让LLM代理在22个物理规则偏离现实的模拟世界中自主发现运动定律,来评估其科学推理能力。每个世界由N体模拟器按需生成,代理需设计多轮实验、观察原始轨迹数据,并提交自然语言解释和Python实现。测试发现,最强模型仅能通过一半世界,尤其在需要发现隐藏结构时失败;开源模型在实验设计和结论提取上显著落后于商业模型。该基准揭示了预测准确性与解释质量之间的差距,强调假设修正和实验设计对概念理解的重要性。
推荐理由:这个基准直击LLM科学推理的软肋——从数据中归纳规律而非回忆知识,做AI评估或科学模拟的团队值得关注,它暴露了当前模型在长程推理和实验设计上的真实短板。
5月22日
5月12日
19:11
19:11官方账号arXiv cs.AI@Edward De Brouwer, Carl Edwards, Alexander Wu, Jenna Collier, Graham Heimberg, Xiner Li, Meena Subramaniam, Ehsan Hajiramezanali, David Richmond, Jan-Christian Hütter, Sara Mostafavi, Gabriele Scalia
AssayBench是一个面向LLM和智能体的表型筛选基准,基于1920个公开CRISPR筛选数据构建,覆盖5类细胞表型。它将任务转化为基因排名预测,并引入adjusted nDCG指标来评估不同实验间的性能。评估显示现有方法距离理论上限较远,且零样本通用LLM优于生物专用LLM和可训练基线。该基准为虚拟细胞模型和药物发现提供了标准化测试平台。
推荐理由:为LLM在生物表型筛选任务中的能力评估提供了首个标准化基准,揭示了当前方法的不足和通用LLM的潜力,对药物研发自动化有实际参考价值。