模型10:55TxBench-PP基准测试:AI Agent在临床前药理学任务中表现不佳想看看AI在药物发现中到底行不行?这个基准测试用4800条轨迹告诉你,Claude Opus 4.8和GPT-5.5都还差得远,最高才59.3%的通过率。#TxBench-PP#Claude Opus 4.8#GPT-5.5#AI agent1 个信源在谈事件专题aarXiv cs.LG@Hannah Le 等 6 人2 个信源在谈原文稍后读已读值得跟进有用关注 TxBench-PP