12:09官方账号arXiv cs.LG@Brandon Wang, Andrei S. Tyrin, Daniil A. Boikoonepot-Bench 0 是面向湿实验室合成化学能力的语言模型评测基准,包含三项子评估。ChemAbacus 考查无需工具的化学信息学素养与数值推理;SynthRefusal 评测模型对苯二氮卓类、受控药物及设计药物等目标的拒绝与安全行为;SynthBench 使用实验室私有实验数据评测反应结果预测和催化剂选择。该基准旨在补充现有评测中缺失的物理实验室可靠决策能力。论文onepot-BenchChemAbacusSynthBench推荐理由:想测语言模型能不能真做化学实验?onepot-Bench 0 用私有数据考反应预测和拒毒能力,比公开题更贴近湿实验室。原文稍后读已读值得跟进有用关注 onepot-Bench