9月2日
09:33
09:33官方一手arXiv: DeepSeek@Huimin Wang, Zhengyi Zhao, Yutian Zhao
精选73°
ClinTraceBench 包含 385 个来自 MIMIC-IV 的验证对话,采用九项任务分类和 L0-L4 确定性验证。研究评估了八种历史表示策略,包括检索、压缩方案和智能体记忆系统,在 6,271 个问题上进行了 200,672 次预测。研究发现压缩策略在多访视趋势和跨患者比较上存在聚合损失,盲法与全上下文方法差距达 29.8-62.7 个百分点。
推荐理由:斯坦福团队发布临床推理基准,测试八种历史表示策略,发现压缩导致关系损失,小模型 Haiku 在全上下文下超越大模型 Sonnet。