09:34官方账号arXiv cs.LG@William Bolton, Philip Torr这项研究将肿瘤药物开发建模为离线决策问题,预测决策日后六个月的试验组合。研究者整合31.7k条公共记录,构成881个离线决策片段,覆盖45个历史项目。对比四种离线目标和四个前沿LLM智能体后,奖励加权行为克隆表现最佳,指示F1达46.2%,严格F1为14.2%;表现最好的工具智能体分别只有25.0%和2.1%。在2025年8月后的数据上,离线训练模型也明显超过未微调基线。论文临床试验离线决策行为克隆推荐理由:用真实试验数据训练AI规划临床试验,奖励加权行为克隆F1达46.2%,比工具智能体高很多,做医药AI的可以看。原文稍后读已读值得跟进有用关注 临床试验