AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

CARE-Bench

共 1 条相关 AI 资讯
8月5日
10:58
10:58官方账号arXiv cs.AI@Yining Hua, Hongbin Na, Cyrus Ayubcha
CARE-Bench是一个源引用的基准,用于评估医疗大模型在患者面对面的分诊任务中,每轮应给出的当前行动建议。基准包含500个病例和1,059个患者披露前缀,覆盖医疗对话、咨询和随访问题来源。在269个保留轮次上评估了11个模型,无提示时宏F1分数在31.2到50.4之间。加入最小提示后,10/11的模型表现提升,宏F1达到46.9到63.4,但仍有大量阈值错误。当正确行为是索取更多信息时,仅有33.5%的模型输出保留了该步骤。
AI模型CARE-Bench医疗分诊评测基准

推荐理由:这个基准测的是医疗分诊模型会不会乱建议,结果发现简单加提示词远远不够,做医疗AI的人都该看看。
原文
精选全部日报登录