模型09:58MedFailBench:临床医生构建的医疗AI安全边界开源基准临床医生亲自设计的AI安全测试,能精准定位模型在哪类医疗错误上出问题,搞医疗AI的必看。#MedFailBench#医疗AI#AI安全#安全边界aarXiv cs.AI@Goktug Ozkan原文稍后读已读值得跟进有用关注 MedFailBench
模型中美对照04:03Perplexity开源内部研究基准WANDRPerplexity把内部跑得最好的研究能力基准WANDR开源了,你要评测推理模型可以拿来用。#Perplexity#WANDR#开源基准#推理模型Aravind Srinivas@AravSrinivas原文稍后读已读值得跟进有用关注 Perplexity