#HealthBench
共 4 条 · 7 天 1 条 · 30 天 1 条
信息流里打上「HealthBench」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
6月22日
百川发布新一代医疗增强大模型 M4:登顶 OpenAI 医疗评测,超越 GPT-5.5
百川发了医疗增强大模型 M4,在 HealthBench 碾压 GPT-5.5,幻觉率仅 3.3%,看病问诊更靠谱。
6月17日
论文10:45
RubricsTree:面向个人健康代理的可扩展开放式评估框架RubricsTree用4000条真实查询构建100多条可验证规则,评估健康AI比LLM裁判更准,还能当训练奖励,让Gemini等模型性能飙升66%。
5月26日
MDIA:多智能体诊断管线在HealthBench上超越ChatGPT for Clinicians
医疗AI开发者注意了:MDIA用架构设计而非提示工程就超越了专业临床模型,做临床决策系统的团队值得研究其7节点路由和药物安全门控设计。