论文09:04Rubric评估对比GPT 5.4、Claude Opus 4.7、Gemini 3.1 Pro临床推理能力这篇论文告诉你当前最强模型在临床推理上有多弱:关键问题正确率不到一半,而简单问题却能答得很准。适合想了解模型真实局限的读者。#GPT 5.4#Claude Opus 4.7#Gemini 3.1 Pro#临床推理aarXiv cs.LG@Samiha A. Ismail 等 3 人原文稍后读已读值得跟进有用关注 GPT 5.4