8月14日
11:23
11:23官方账号arXiv cs.LG@Yunsung Chung, Yingshuo Liu, Abboud F. Hassan, Han Feng, Mary M. Maleckar, Nassir Marrouche, Jihun Hamm
提出干预感知临床世界模型,将术后恢复视为随时间展开的不规则轨迹。模型将基线影像编码为3D空间潜在状态,并用手术上下文与生理嵌入更新。在DECAAF-II数据集上,预测房颤消融90天复发的AUROC为0.756、AUPRC为0.777。无需随访MRI强度,疤痕范围MAE为2.971个百分点。潜在状态支持90天内不同时间范围的风险查询与空白期记录编辑。
推荐理由:论文提出干预感知模型,用房颤消融后不规则记录预测复发,DECAAF-II上AUROC 0.756,推理时免随访MRI强度。
11:19
11:19官方账号arXiv cs.LG@David Chushig-Muzo, María Ángeles Rodríguez de Cara, Eva Milara, Francisco J. Lara-Abelenda, Luis Zhinin-Vera, Diego H. Peluffo-Ordóñez
TabSOM是一种基于自组织映射的表格转图像编码方法,通过颜色匈牙利赋值让每个特征占据固定画布位置。它用SOM组件平面构建捕获特征两两关系的图,并堆叠多尺度节点通道来编码特征值与交互。与十二种现有表格转图像方法在公开二分类数据集上对比,TabSOM在每个数据集上排名第一或第二,且方差最低。其可解释性结果与Random Forest、XGBoost和SHAP验证,类分离分数与基线一致并补充结构信息。
推荐理由:做表格分类想用深度学习?TabSOM把表格变成图像,打平十二种老方法还更稳,连特征关系都能可视化,值得试。
11:08
11:08官方账号arXiv cs.LG@Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng, Erfei Cui, Xuanlang Dai, Shengyuan Ding, Shangheng Du, Yanhui Duan, Yue Fan, Youqing Fang, Quan Gan, Yuanyuan Gao, Jiaye Ge, Lixin Gu, Yuzhe Gu, Qipeng Guo, Junjun He, Xin Hong, Ming Hu, Zhouqi Hua, Haian Huang, Junhao Huang, Zixian Huang, Minxi Jin, Lingkai Kong, Alexander Lam, Zehao Li, Zonglin Li, Tianhao Liang, Dahua Lin, Junyao Lin, Tianyang Lin, Zhouhan Lin, Jiangning Liu, Jin Liu, Kuikun Liu, Wenran Liu, Yifei Liu, Yuhong Liu, Yuhong Liu, Zhoumianze Liu, Ziyan Liu, Ziyu Liu, Haijun Lv, Han Lv, Chengqi Lyu, Le Ma, Ningsheng Ma, Zerun Ma, Haoyang Peng, Runyu Peng, Jifei Shan, Zixin Shang, Kou Shi, Xiang Shi, Qisheng Su, Xuerui Su, Hao Sun, Xiao Sun, Yanan Sun, Yu Sun, Huanze Tang, Yinghao Tang, Wenhui Tian, Zhongbo Tian, Bingli Wang, Haomin Wang, Jiarui Wang, Jingzhi Wang, Rui Wang, Xiquan Wang, Yi Wang, Zhecan Wang, Ziyi Wang, Zun Wang, Rubin Wei, Lianyi Wu, Wen Wu, Yue Wu, Yuhan Wu, Zhenyu Wu, Zijian Wu, Shuhao Xing, Jun Xu, Xingle Xu, Xuenan Xu, Xiangchao Yan, Ziang Yan, Bowen Yang, Danni Yang, Lin Yang, Zhiqi Yang, Qian Yao, Haochen Ye, Peng Ye, Jinhui Yin, Jiashuo Yu, Dingbo Yuan, Fei Yuan, Yuhang Zang, Bo Zhang, Chao Zhang, Chen Zhang, Hongjie Zhang, Junming Zhang, Wenlong Zhang, Wenwei Zhang, Yiming Zhang, Zhuo Zhang, Ziyang Zhang, Haiteng Zhao, Penghao Zhao, Yibo Zhao, Zhonghan Zhao, Zhihang Zhong, Bowen Zhou, Peiheng Zhou, Xin Zhou, Xinyu Zhou, Yunhua Zhou, Dongsheng Zhu, Yicheng Zou
Intern-S2-Preview 是一系列面向科学发现的智能体基础模型,支持多模态科学理解、推理、生成和长周期任务。训练流程包含科学多模态预训练、监督微调、多任务强化学习及智能体 RL,并引入部分 rollout、自适应长度正则化等技巧提升稳定性。其中 Intern-S2-Preview-397B 在 SciTS 时间序列基准上取得领先表现,同时其时间序列模块增强了科学信号理解与预测。独立的 Intern-MemDec-4B 扩展将 Biology-Instructions 平均分从 56.92 提升至 60.32,且无需修改冻结的 397B 主干。
推荐理由:这个科学智能体模型能处理多模态数据,397B 版在时间序列预测上很强,还有个 4B 小模型能直接把生物任务分数拉高,适合搞科研的人看看。
10:39
10:39官方账号arXiv cs.LG@Yi-Chung Chen, Philip Jacobson, Tom Lampo, Yiren Lu, Jin Yao, David I. Inouye, Jing Gao, Danhua Guo, Burhan Yaman
论文提出TraVEL方法,用于提升驾驶视频检索。研究者先在nuReasoning数据集上对Qwen3-VL-Embedding进行InfoNCE微调,再引入轨迹相似度作为GRPO奖励。相比纯监督微调,TraVEL在2B模型上使纵向和横向mAP分别提升9.8和4.7个百分点,在8B模型上分别提升7.2和1.5个百分点。该方法不需要外部感知输出,推理时仅靠单向量检索。
推荐理由:想搞自动驾驶数据检索的可以看看这个TraVEL,用行车轨迹当训练信号,让模型更懂左转右转、加速减速,比普通微调强不少。
10:38
10:38官方账号arXiv cs.LG@Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bali, Stefan Krsteski, Harsh Raj, Huu Nguyen, Jannik Brinkmann, Ashton Anderson, Roland Aydin, Robert West
论文提出合成人格预训练(SPP),在预训练阶段就从第一个 token 开始植入目标助手人格,而非等预训练后叠加价值观。方法先用价值规范给预训练文档标注第一人称反思,再在标准文档和反思上以交叉熵损失训练,最后用对话数据做人格绑定。在 3B 参数、500B token 的预训练中,SPP 提高了宪法遵循和越狱鲁棒性,降低了分布外道德困境中的错位率,同时保持能力。实验显示,仅在预训练末期引入 SPP 效果明显更弱,且优势随预训练预算增加而增大。
推荐理由:这篇把对齐提前到了预训练第一步,3B 模型跑 500B token,越狱更难破,值得搞 AI 安全的人看一眼。
8月13日
17:54
17:54官方账号arXiv cs.LG@Aleksandra Kalisz, Jack Simons, Krisztina Sinkovics, Noam Ghenassia, Shikha Surana, Henry Moss, Paul Duckworth
蛋白质结构预测基础模型在某些靶标上仍不可靠,外部 oracle 可纠正错误但成本高昂。一篇论文系统对比了 FK-steering、DPO、Best K-of-N 和最新提出的 O3 四种预算分配方法。在钙调蛋白(1CLL)和大肠杆菌天冬氨酸转氨甲酰酶(9EEH)两个靶标上,没有单一方法在所有预算下都占优。O3 在低预算时最有效,而 FK-steering 和 DPO 随预算增加表现更好。该研究给出了针对实际 oracle 预算约束的可操作建议。
推荐理由:做蛋白质结构预测的可以看看这篇,它对比了四种 oracle 预算分配方法,告诉你低预算用 O3,高预算用 FK-steering 和 DPO,挺实用。
17:49
17:49官方账号arXiv cs.AI@Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor
精选
研究人员推出VAKRA基准,包含62个领域的8000多个可执行API,用于测试智能体在工具使用策略约束下的多跳推理。最佳模型在单跳端点任务上准确率只有70.4%,在组合API任务上降至50-51%。当推理深度增加时,模型性能下降超过50%。在策略约束的不可回答查询上,部分模型准确率低至2.4%。错误分析显示,失败主要集中在实体消歧和跨源信息对齐等语言中介推理环节。
推荐理由:IBM新基准VAKRA,测API和文档多跳推理,最强70.4%,多跳掉一半,暴露AI短板。
17:48
17:48官方账号arXiv cs.AI@Zile Zhou, Huining Yuan, Weichen Zhang, Xinlei Chen, Xiao-ping Zhang
SCOUT 提出结构化思维链框架,显式建模 3D 环境感知以增强空间理解。其强化学习算法引入多目标过程奖励和定制的优势估计方法,实现推理轨迹的细粒度信用分配。研究者构建了 SCOUT-24k 结构化空间推理数据集。SCOUT-3B 在通用空间基准上提升 16.85%,在复杂空间推理任务上提升 6.3%。SCOUT-7B 超出 GPT-4o 4.28%,且能泛化到多图像和视频场景。
推荐理由:空间推理一直是视觉语言模型的硬伤,SCOUT 用新的训练方法把 3D 理解做得更准,7B 规模直接超过 GPT-4o,还能迁移到视频上。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。