主要来源Sam Altman
查看原文事件专题 · 多源确认
GPT-5.6医疗评估:医生挑出的错误比医生写的回答还少
OpenAI发布GPT-5.6系列,在医疗任务中表现优于医生。最小变体GPT-5.6 Luna在最低推理努力下即超越GPT-5.5最高推理努力,成本降低25倍。最大变体GPT-5.6 Sol创下新标杆。研究收集了患者和临床医生两类任务,由专科医生花费无限时间并联网撰写回答,再由另一些医生盲评。在20000次轴评级(准确性、沟通、完整性、指令遵循、健康决策有用性)中,所有GPT-5.6变体在完美率上显著超过医生。
当前结论
OpenAI发了GPT-5.6,医生写回答都写不过它,成本还更低,医疗AI又进步了一大截
11 个信源83° AI 热度最后更新 2026/7/11 16:46:22
证据链
相关来源 1Greg Brockman
查看原文相关来源 2@OpenAIDevs
查看原文相关来源 3GitHub
查看原文相关来源 4Simon Willison’s Weblog
查看原文相关来源 5Poe
查看原文相关来源 6Genspark
查看原文相关来源 7LlamaIndex
查看原文相关来源 8Jerry Liu
查看原文相关来源 9OpenAI
查看原文相关来源 10SuperTechFans
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。