7月29日
11:23
11:23官方一手arXiv: DeepSeek@Jia Liu, Veena Krishnaraj, Kateryna Vovk, Kosuke Aizawa, Adrian E. Bayer, Linda Blot, Jessica Cowell, Suyog Garg, Jonathan Grée, Anamaria Hell, Ben Horowitz, Masaya Ichikawa, Kanyuni Iemoto, Keigo Kondo, Zacharie Lorsin, Kevin McCarthy, Jamie Robinson, Miguel Ruiz-Granda, Leander Thiele, Ievgen Vovk, Mingshen Zhou
该研究测试了大型语言模型(LLMs)在科研项目规划和提案评估中的表现。人类研究者与ChatGPT、Claude、DeepSeek(2025年中模型)分别生成了8个专家构思的研究项目的一页计划,共计32份提案。4位人类评审员和2个前沿LLM(Claude Opus 4.8、ChatGPT Pro 5.5)采用四维度评估标准盲审。人类评审员对AI和人类提案的整体评分相似,而AI评审员对AI提案的评分平均高出约1分(5分制)。人类评审员正确识别人类和AI提案的比例分别为72%和79%,而两个AI评审员均100%正确分类。研究表明当前LLM能生成与人类提案相当的计划,但AI评审员存在系统性偏好。
推荐理由:这篇论文测试了ChatGPT、Claude、DeepSeek写科研计划的能力,发现人类评委分不出好坏,但AI评委偏爱AI写的。值得一读。
11:21
11:21官方账号arXiv cs.LG@Simple AI, :, Yuteng Wei, Jinming Ma, Jiawei Wang, Weitao Zhou, Yushen Zuo, Ke Rui, Minglei Li, Jinhao Zhang, Zhikang Pan, Xiang Wang, Haoran Jia, Huan Du, Zicheng Zeng, Jun Ma, Guiyu Qin, Di Zhang, Xiaofei Li
HiFi-UMI是一个便携式UMI数据生产系统,无需外部跟踪即可达到3毫米末端执行器精度。它通过头戴式立体惯性SLAM、原生相对位姿、微秒级GPIO触发和每只手两个广角相机(覆盖约200度)提升数据质量。使用该数据后训练的策略可直接部署到真实机器人,在StarVLA-QwenPI、OpenPI-pi_0.5和LingBot-VA三个骨干上成功率差异仅为-2.5、+3.1和-0.6个百分点。在精密插入任务上最强策略达到85%成功率。预训练4000小时可将十个未见任务的动作误差降低41%,并在StarVLA-QwenPI上将真实机器人成功提升18.1个百分点。研究团队开源了2000小时微秒同步超广角数据集HiFi-UMI-2K。
推荐理由:HiFi-UMI造了一套便携数据采集系统,不用真机器人就能让策略直接部署,精度3mm,效果跟真实遥操作差不多,还开源了2000小时数据集,搞机器人操作的可以看看。
11:20
11:20官方账号arXiv cs.LG@ Sha, Miao, Alexandra Vendetti, Logan Smart, Gunta Chomchalerm, Yang Chen, Christopher Frazier, Dustin Haralson, Jeremy Sorenson, Xiao Ma, Huafei Sun, Aaron Shinn, Haining Zheng, Xiao-Hui Wu, Peng Xu
论文提出一种自动化数据驱动工作流,集成ML模型预测气举性能曲线,并采用贝叶斯优化框架在设施容量约束下求解最优注气速率。该ML模型仅需历史生产时间序列数据,无需井下压力计或多速率试井。在Bakken油田5个井场30口井的试点中平均增产超过5%,目前已全面部署至200余口气举及柱塞辅助气举井。此方法特别适用于因成本或设施限制无法获取井下数据或多速率测试的资产。
推荐理由:这篇论文用ML加贝叶斯优化,在Bakken油田200多口井实现了5%以上的增产,不用额外下设备,省钱又高效。
11:13
11:13官方账号arXiv cs.AI@Rui Yang, Weihao Xuan, Yi Lin, Zhuhan Bao, Jonathan Chong Kai Liew, Matthew Yu Heng Wong, Nicolás Lescano, Nikita R. Paripati, Emily Ling-Lin Pai, Jiarui Liu, Heli Qi, Heng-Jui Chang, Benny Kai Guo Loo, Huitao Li, Kunyu Yu, Yufan Wang, Chuan Hong, Shijian Lu, Douglas Teodoro, Naoto Yokoya, Ross Koppel, Mona Diab, Hua Xu, David W. Bates, Nan Liu, Yifan Peng
ClinMM-Bench是迄今最大的多轮多模态临床诊断评估基准,包含1089个真实临床案例和3760张医学图像,覆盖8个专科。研究使用两级评估框架,对15个代表性多模态大模型进行诊断准确性和推理质量评测。结果显示,专有模型总体准确率最高,但完全正确诊断的比例仍很低。错误分析识别出信息整合失败、知识映射错误、感知错误、过早闭合和视觉幻觉五种典型失败模式。
推荐理由:临床诊断AI评估有新基准了!1089个真实案例、3760张影像,15个模型测试下来发现,再好的模型完全正确诊断率也不高,而且容易犯信息整合错误和视觉幻觉。
11:11
11:11官方账号arXiv cs.AI@Tereza Kinská, Jan Křetínský, Tobias Meggendorfer, Sabine Rieder, Maximilian Weininger
dtControl2+ε扩展了dtControl2工具,针对马尔可夫决策过程(MDP)中的控制器表示问题。通过引入允许的精度损失参数ε≥0,该工具能生成更小的决策树,同时保证ε-最优性。相比现有最优方法,生成的决策树规模可减少数个数量级,从而提升人机理解释性。方法在保持核心控制逻辑的前提下,可控地省略细节。
推荐理由:想搞懂马尔可夫决策过程控制器可解释性的可以看看这个。dtControl2+ε用ε容忍度换更小更易懂的决策树,比原先的压缩效果好很多。
11:10
11:10官方账号arXiv cs.AI@Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman
该研究探索了视觉语言模型(VLMs)在基于agent的游戏QA管道中检测几何裁剪异常。自定义探索agent收集视觉数据,自动标注管道提供帧级标签。零样本设置下测试了Gemini、GPT、Qwen、Gemma、Llama和Ministral六种VLM及四种提示变体。Gemini-3.1-Flash在总体准确率和提示鲁棒性上表现最佳,开源模型则对提示设计敏感。当前VLMs更适合作为多阶段QA管道中的高召回候选过滤器。
推荐理由:这篇论文用六种VLM检测游戏里的几何裁剪bug,发现Gemini最稳,开源模型要看怎么问提示词。想了解VLM实际落地坑点的可以看看。
10:38
10:38官方账号arXiv cs.LG@Weixin Liu, Juming Xiong, Congning Ni, Yanfan Zhu, Xingtao Lin, Bradley A. Malin, Zhijun Yin
DRIFT是一个混合框架,结合直接预测与递归动作条件校正。在MIMIC-IV(6046次住院)和eICU-CRD(8345次住院)上评估,8/24/48小时平均动脉压(MAP)平均绝对误差相比动作条件TFT(TFT-action)降低0.673%。在处理序列变化的窗口内,DRIFT在8和24小时MAP误差低于TFT-action。序列变化导致DRIFT的MAP误差增加0.21-0.26 mmHg,预测差异主要出现在路径分叉后。
推荐理由:这篇论文提出了DRIFT,一种ICU生理轨迹预测新方法,在MIMIC-IV和eICU-CRD上比TFT-action的MAP误差低0.67%,尤其在治疗序列变化时表现更准。
09:36
09:36官方账号arXiv cs.LG@Moisés Santos, Peter van der Putten, Bernhard Pfahringer, Carlos Soares
Rashomon Alignment (RA) 从几何视角衡量两个模型的功能相似性,不依赖于特定数据分布。RA 通过均匀采样计算几何对齐,在超过90个数据集上进行了实验。实验结果表明,几何对齐与分布对齐提供互补的相似性信息。RA 可用于模型选择、集成构建和模型可解释性。
推荐理由:这篇论文提出了一个衡量模型相似性的新方法,从几何角度看模型决策边界,在90多个数据集上验证了效果,适合需要做模型选型或集成的朋友参考。
7月28日
12:27
12:27官方账号arXiv cs.AI@Krithi Shailya, Ananya Lakshmi Ravi, Venkatanathan K. V., Sowmya S. Sundaram, Gokul S. Krishnan, Aditi Anand, Balaraman Ravindran
研究者提出KANEx框架,首次利用KAN(Kolmogorov-Arnold Networks)的符号透明性来支撑VLM推理,从而生成更可信的文本解释。同时设计了KAN-Map热力图方法,直接从KAN模型导出而非梯度近似。在MIMIC-CXR数据集上,基于KAN的ResNet/ViT架构语义相似性提升,并产生更忠实的显著性图。定位和推理质量比基线提高10%。论文认为将语言解释和视觉归因建立在数学可解释单元上是可信医疗AI的必要步骤。
推荐理由:这篇论文展示了KAN不只是理论上可解释,还能落地到医学影像中,让解释更可靠,比标准ResNet/ViT定位准确率提升10%。
12:26
12:26官方账号arXiv cs.AI@Zhen Huang, Yikun Wang, Shijie Xia, Pengfei Liu
DataOrchestra提出针对每个数据样本定制处理流程,统一丢弃、保留或清洗操作。清洗时选择程序化编辑或LLM重写,并生成具体指令。在0.5B至7B模型上从零预训练,11个基准平均提升优于单个处理方法。数学持续预训练中超过更强基线,且跳过不必要操作减少计算量。
推荐理由:这篇论文提出了DataOrchestra,能针对每个数据样本定制清洗流程,在多个模型和基准上都有提升,还节省算力。
12:23
12:23官方账号arXiv cs.AI@Ali Ansari, Yasmin Mohammadi, Farnoush Nili, Parsa Esmaeilkhani, Longin Jan Latecki, Eduard Dragut
ERUnderstand是首个大规模评估视觉语言模型(VLM)对实体关系图(ERD)结构化理解能力的基准,包含2960张来自教育、真实世界和合成数据源的图。测试发现常见元素F1>0.74,但弱实体F1低至0.28,多值属性仅0.14,N元关系仅0.07。使用推理增强的模型整体提升15%-25%,但仍受语言先验和复杂度影响。基准、数据、工具和生成代码已开源。
推荐理由:想测VLM能不能看懂ER图?这个新基准用2960张图挨个打分,弱实体和N元关系掉得厉害,读论文就能知道差距在哪儿。

仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。