事件专题 · 多源确认

GPT-5.6医疗评估:医生挑出的错误比医生写的回答还少

OpenAI发布GPT-5.6系列,在医疗任务中表现优于医生。最小变体GPT-5.6 Luna在最低推理努力下即超越GPT-5.5最高推理努力,成本降低25倍。最大变体GPT-5.6 Sol创下新标杆。研究收集了患者和临床医生两类任务,由专科医生花费无限时间并联网撰写回答,再由另一些医生盲评。在20000次轴评级(准确性、沟通、完整性、指令遵循、健康决策有用性)中,所有GPT-5.6变体在完美率上显著超过医生。

当前结论

OpenAI发了GPT-5.6,医生写回答都写不过它,成本还更低,医疗AI又进步了一大截

11 个信源83° AI 热度最后更新 2026/7/11 16:46:22

证据链

相关来源 4Simon Willison’s Weblog
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情