11:23
11:23
官方一手arXiv: DeepSeek@Jia Liu, Veena Krishnaraj, Kateryna Vovk, Kosuke Aizawa, Adrian E. Bayer, Linda Blot, Jessica Cowell, Suyog Garg, Jonathan Grée, Anamaria Hell, Ben Horowitz, Masaya Ichikawa, Kanyuni Iemoto, Keigo Kondo, Zacharie Lorsin, Kevin McCarthy, Jamie Robinson, Miguel Ruiz-Granda, Leander Thiele, Ievgen Vovk, Mingshen Zhou 该研究测试了大型语言模型(LLMs)在科研项目规划和提案评估中的表现。人类研究者与ChatGPT、Claude、DeepSeek(2025年中模型)分别生成了8个专家构思的研究项目的一页计划,共计32份提案。4位人类评审员和2个前沿LLM(Claude Opus 4.8、ChatGPT Pro 5.5)采用四维度评估标准盲审。人类评审员对AI和人类提案的整体评分相似,而AI评审员对AI提案的评分平均高出约1分(5分制)。人类评审员正确识别人类和AI提案的比例分别为72%和79%,而两个AI评审员均100%正确分类。研究表明当前LLM能生成与人类提案相当的计划,但AI评审员存在系统性偏好。
推荐理由:这篇论文测试了ChatGPT、Claude、DeepSeek写科研计划的能力,发现人类评委分不出好坏,但AI评委偏爱AI写的。值得一读。
11:21
11:21
官方账号arXiv cs.LG@Simple AI, :, Yuteng Wei, Jinming Ma, Jiawei Wang, Weitao Zhou, Yushen Zuo, Ke Rui, Minglei Li, Jinhao Zhang, Zhikang Pan, Xiang Wang, Haoran Jia, Huan Du, Zicheng Zeng, Jun Ma, Guiyu Qin, Di Zhang, Xiaofei Li HiFi-UMI是一个便携式UMI数据生产系统,无需外部跟踪即可达到3毫米末端执行器精度。它通过头戴式立体惯性SLAM、原生相对位姿、微秒级GPIO触发和每只手两个广角相机(覆盖约200度)提升数据质量。使用该数据后训练的策略可直接部署到真实机器人,在StarVLA-QwenPI、OpenPI-pi_0.5和LingBot-VA三个骨干上成功率差异仅为-2.5、+3.1和-0.6个百分点。在精密插入任务上最强策略达到85%成功率。预训练4000小时可将十个未见任务的动作误差降低41%,并在StarVLA-QwenPI上将真实机器人成功提升18.1个百分点。研究团队开源了2000小时微秒同步超广角数据集HiFi-UMI-2K。
推荐理由:HiFi-UMI造了一套便携数据采集系统,不用真机器人就能让策略直接部署,精度3mm,效果跟真实遥操作差不多,还开源了2000小时数据集,搞机器人操作的可以看看。
11:20
11:20
官方账号arXiv cs.LG@ Sha, Miao, Alexandra Vendetti, Logan Smart, Gunta Chomchalerm, Yang Chen, Christopher Frazier, Dustin Haralson, Jeremy Sorenson, Xiao Ma, Huafei Sun, Aaron Shinn, Haining Zheng, Xiao-Hui Wu, Peng Xu 论文提出一种自动化数据驱动工作流,集成ML模型预测气举性能曲线,并采用贝叶斯优化框架在设施容量约束下求解最优注气速率。该ML模型仅需历史生产时间序列数据,无需井下压力计或多速率试井。在Bakken油田5个井场30口井的试点中平均增产超过5%,目前已全面部署至200余口气举及柱塞辅助气举井。此方法特别适用于因成本或设施限制无法获取井下数据或多速率测试的资产。
推荐理由:这篇论文用ML加贝叶斯优化,在Bakken油田200多口井实现了5%以上的增产,不用额外下设备,省钱又高效。
11:13
11:13
官方账号arXiv cs.AI@Rui Yang, Weihao Xuan, Yi Lin, Zhuhan Bao, Jonathan Chong Kai Liew, Matthew Yu Heng Wong, Nicolás Lescano, Nikita R. Paripati, Emily Ling-Lin Pai, Jiarui Liu, Heli Qi, Heng-Jui Chang, Benny Kai Guo Loo, Huitao Li, Kunyu Yu, Yufan Wang, Chuan Hong, Shijian Lu, Douglas Teodoro, Naoto Yokoya, Ross Koppel, Mona Diab, Hua Xu, David W. Bates, Nan Liu, Yifan Peng ClinMM-Bench是迄今最大的多轮多模态临床诊断评估基准,包含1089个真实临床案例和3760张医学图像,覆盖8个专科。研究使用两级评估框架,对15个代表性多模态大模型进行诊断准确性和推理质量评测。结果显示,专有模型总体准确率最高,但完全正确诊断的比例仍很低。错误分析识别出信息整合失败、知识映射错误、感知错误、过早闭合和视觉幻觉五种典型失败模式。
推荐理由:临床诊断AI评估有新基准了!1089个真实案例、3760张影像,15个模型测试下来发现,再好的模型完全正确诊断率也不高,而且容易犯信息整合错误和视觉幻觉。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。