主要来源IT之家
查看原文事件专题 · 多源确认
百川发布新一代医疗增强大模型 M4:登顶 OpenAI 医疗评测,超越 GPT-5.5
百川智能与清华大学联合发布医疗增强大模型 Baichuan-M4。该模型在 HealthBench 综合得分 68.6,超越 GPT-5.5 超 10 分,幻觉率低至 3.3%。在 SCAN-bench 动态问诊评测中初诊 79.0、复诊 74.7,均领先 GPT-5.5、DeepSeek-V4-Pro 和 Claude Opus 4.7。M4 还具备全病程记忆功能,长上下文临床记忆得分 86.9,较上一代 M3 提升 21.1 分。其证据锚定机制使循证引用精度达到 90.0,远超 GPT-5.5 的 54.7。
当前结论
百川发了医疗增强大模型 M4,在 HealthBench 碾压 GPT-5.5,幻觉率仅 3.3%,看病问诊更靠谱。
11 个信源53° AI 热度最后更新 2026/6/22 09:12:18
证据链
相关来源 1arXiv: OpenAI
查看原文相关来源 2OpenAI Blog
查看原文相关来源 3berryxia
查看原文相关来源 4@koltregaskes
查看原文相关来源 5shao__meng
查看原文相关来源 6Aravind Srinivas
查看原文相关来源 7marktechpost
查看原文相关来源 8Decoder
查看原文相关来源 9Gary Marcus
查看原文相关来源 10orange.ai
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。