主要来源arXiv: OpenAI
查看原文事件专题 · 官方一手
MDIA:多智能体诊断管线在HealthBench上超越ChatGPT for Clinicians
研究者提出MDIA,一个由7个专科路由节点组成的多智能体临床推理图,在HealthBench Professional基准(525个病例)上,使用未微调的GPT-5.4-2026-03-05模型达到0.6272分,比OpenAI的ChatGPT for Clinicians高出3.72个百分点。性能提升主要来自系统架构设计,包括专科路由、多轮上下文保持、药物状态安全门控、站点过滤搜索、长度感知合成和引擎级可靠性。实验还发现,使用不同模型作为评分者时结果差异显著,例如Gemini 2.5 Pro评分时MDIA得分0.6585,表明评估需要多个独立评分模型。该研究证明,智能体临床基准性能既取决于基础模型,也取决于编排架构。
当前结论
医疗AI开发者注意了:MDIA用架构设计而非提示工程就超越了专业临床模型,做临床决策系统的团队值得研究其7节点路由和药物安全门控设计。
11 个信源58° AI 热度最后更新 2026/5/23 18:36:58
证据链
相关来源 1Greg Brockman
查看原文相关来源 2小互
查看原文相关来源 3rohanpaul_ai
查看原文相关来源 4AI Will
查看原文相关来源 5IT之家
查看原文相关来源 6marktechpost
查看原文相关来源 7Decoder
查看原文相关来源 8Gary Marcus
查看原文相关来源 9OpenAI Blog
查看原文相关来源 10Geek
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。