论文09:34离线策略训练:为决策智能体学习临床试验规划用真实试验数据训练AI规划临床试验,奖励加权行为克隆F1达46.2%,比工具智能体高很多,做医药AI的可以看。#临床试验#离线决策#行为克隆#LLMaarXiv cs.LG@William Bolton, Philip Torr原文稍后读已读值得跟进有用关注 临床试验