15:54官方账号Decoder@Jonathan KemperRadLE 2.0基准测试评估AI模型在放射学中判断何时应由人类接手诊断的能力。测试发现,许多AI模型在给出错误结论时仍表现出完全自信,而人类放射科医生的准确率仍显著更高。该基准聚焦于模型的自知力,强调AI必须学会在不确定时保持沉默,才能安全投入临床。AI模型RadLE 2.0放射学医疗AI推荐理由:RadLE 2.0测试发现AI读X光常常自信地犯错,人类医生还远领先。搞医疗AI的该看看这个教训。原文稍后读已读值得跟进有用关注 RadLE 2.0