15:25官方账号arXiv cs.AI@Minh-Ha Nguyen, Cathy ShyrPIHF(Policy Iteration with Human Feedback)提出了一种利用预训练语言模型作为执行基底,通过版本化的自然语言策略和工具集进行持续改进的方法。该方法结合了语言模型评论家和临床专家的审查,以定位重复失败并形成候选修订。在超罕见疾病基准测试中,PIHF派生的策略在多个执行器上提升了Recall@1,其中GPT-5.4提升32.7个百分点,Qwen3.6-35B提升31.1个百分点。结果表明,固定权重的预训练语言模型可用于专家引导的策略开发。论文PIHF上下文学习强化学习推荐理由:PIHF把强化学习的迭代改进搬到了上下文学习里,用语言模型当执行器,专家审阅改进,罕见病诊断上Recall@1提升明显,值得一看。原文稍后读已读值得跟进有用关注 PIHF
09:14官方一手arXiv: DeepSeek@Guiling Guo, Jia Yang, Jiahao Xu, Shuyuan Zheng, Zhonghai Sun, Qiyuan LiGraphRareBench是一个保留来源的基准,包含2,365个本体派生案例和18,093对目标-混淆对。在237个案例的基因组分测试集上,监督排序器MRR范围为0.640-0.740,目标-混淆准确率为0.898-0.916。基于Agents-A1和DeepSeek-V4-Flash的智能体MRR分别为0.746和0.718,但证据覆盖率差异达0.561。22.1%到43.7%的成功案例中仍存在硬混淆者排名高于目标。该基准可用于评估模型在完全集检索和硬混淆区分上的表现。论文GraphRareBenchAgents-A1DeepSeek-V4-Flash1 个信源在谈事件专题推荐理由:想测AI罕见病诊断能力?GraphRareBench用2365个案例和18093对混淆,专门检测模型能不能分清真病和假病。原文稍后读已读值得跟进有用关注 GraphRareBench
09:46官方一手arXiv: DeepSeek@Haichao Chen, Songchi Zhou, Zhengyun Zhao, Shikai Hu, Xianghong Jin, Hongwei Ji, Li He, Shuli Li, Yiming Qin, Xin Tan, Runfeng Shi, Yih Chung Tham, Jiaye Zhu, Ye Li, Ye Jin, Longhao Cao, Dawei Li, Honghan Wu, Hongqiu Gu, Guanqiao Li, Tudor Groza, Chunying Li, Dian Zeng, Weihong Yu, Gareth Baynam, Saumya Shekhar Jamuar, Min Shen, Shuyang Zhang, Bin Sheng, Sheng Yu, Tien Yin Wong71°RaDaR是一个32B参数的开源推理大模型,专为罕见病诊断设计。它在公开基准和四个外部验证中心中优于包括671B DeepSeek-R1在内的开源模型。在回顾性队列中,RaDaR在61.06%的病例中比临床怀疑更早给出最终诊断,提前时间1.87个月。在随机医生辅助试验中,RaDaR帮助医生诊断准确率提高21.44个百分点。合成数据消融实验表明表型锚定叙事对长尾罕见病提供有用训练信号。AI模型RaDaRDeepSeek-R1开源模型推荐理由:RaDaR发布了一个32B开源推理模型,罕见病诊断比DeepSeek-R1还强,医生用它准确率提升21%。原文稍后读已读值得跟进有用关注 RaDaR
00:36官方一手OpenAI Blog(博客/媒体)波士顿儿童医院利用OpenAI技术改善患者护理、减轻运营负担,并成功帮助诊断了40多例罕见病。该医院通过AI辅助分析复杂病例,提高了诊断效率和准确性,尤其对罕见病领域意义重大。这一应用展示了AI在医疗诊断中的实际价值,为其他医疗机构提供了可借鉴的案例。AI产品医疗AI罕见病诊断OpenAI10 个信源在谈事件专题推荐理由:医疗从业者和AI应用开发者值得关注——波士顿儿童医院用AI解决了罕见病诊断难的问题,直接提升了患者生存率,建议点开了解具体实现路径。原文稍后读已读值得跟进有用关注 医疗AI