主要来源arXiv: OpenAI
查看原文事件专题 · 官方一手
ABC-Bench:评估LLM智能体的生物安全能力基准
ABC-Bench(Agentic Bio-Capabilities Benchmark)是一个用于评估大型语言模型智能体在生物安全相关任务上能力的基准测试套件。它包含三类任务:编写代码操作液体处理机器人、设计用于体外组装的DNA片段、以及规避DNA合成筛选。所有测试的LLM智能体在三项任务上均超过了人类专家基线水平,但在需要新颖生物信息推理的任务上表现较弱。湿实验验证显示,OpenAI的o4-mini-high模型生成的脚本成功在OpenTrons机器人上组装出预期序列的DNA。该基准旨在量化AI在生物研究中的双刃剑效应——既推动科学进步,也带来新的生物安全风险。
当前结论
这是首个系统评估LLM智能体在生物安全关键任务上能力的基准,做AI安全或生物计算的研究者值得关注——它揭示了当前模型在复制已知协议时很强,但在创新推理上仍有短板。
8 个信源72° AI 热度最后更新 2026/6/9 17:35:37
证据链
相关来源 1lmarena.ai
查看原文相关来源 2AI Will
查看原文相关来源 3The Rundown AI
查看原文相关来源 4rohanpaul_ai
查看原文相关来源 5PolymarketMoney
查看原文相关来源 6shao__meng
查看原文相关来源 7IT之家
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。