7月29日
10:38
10:38官方账号arXiv cs.LG@Weixin Liu, Juming Xiong, Congning Ni, Yanfan Zhu, Xingtao Lin, Bradley A. Malin, Zhijun Yin
DRIFT是一个混合框架,结合直接预测与递归动作条件校正。在MIMIC-IV(6046次住院)和eICU-CRD(8345次住院)上评估,8/24/48小时平均动脉压(MAP)平均绝对误差相比动作条件TFT(TFT-action)降低0.673%。在处理序列变化的窗口内,DRIFT在8和24小时MAP误差低于TFT-action。序列变化导致DRIFT的MAP误差增加0.21-0.26 mmHg,预测差异主要出现在路径分叉后。
推荐理由:这篇论文提出了DRIFT,一种ICU生理轨迹预测新方法,在MIMIC-IV和eICU-CRD上比TFT-action的MAP误差低0.67%,尤其在治疗序列变化时表现更准。
6月2日
11:08
11:08官方账号arXiv cs.AI@Jiaming Wang, Ziteng Feng, Jiangtao Wu, Ruihao Li, Qianqian Xie, Yuxiang Ren, He Zhu, Xueming Han, Fanyu Meng, Junlan Feng, Jiaheng Liu
精选72°
论文研究深度研究代理在长轨迹中的错误定位问题,指出仅靠最终答案评估无法揭示轨迹中的不可靠部分。作者收集了 2,790 条真实轨迹,通过 LLM 辅助专家标注构建了 TELBench 基准,包含 1,000 个实例用于识别错误跨度。提出 DRIFT 框架,以声明为中心审计代理轨迹,追踪声明并检查证据支持,在多个模型和审计框架上将跨度级错误定位和首次错误准确率提升最多 30 个百分点。该工作为深度研究代理的可靠性提供了过程级视角。
推荐理由:做 AI 代理评估或可靠性研究的团队会感兴趣——DRIFT 框架直接解决了「只看结果不看过程」的盲区,建议点开看看方法细节。