12:41
12:41 官方账号 arXiv cs.LG @Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li RynnValue是一个开源的机器人操作价值基础模型,用时间距离替代偏好或进度作为监督信号,可从时间戳直接生成标签,无需额外标注。该模型在7000多小时、约300万条指令条件片段上训练,在RBM-EVAL-OOD基准上平均Kendall's tau_a达0.675,超过偏好监督的SOTA(0.655),并是仅进度监督基线(0.292)的两倍多。通过势能塑形转为稠密奖励后,RynnValue将真实世界策略成功率从52.5%提升至72.5%(在线),离线从63.8%提升至82.5%。 推荐理由: 想搞机器人奖励模型但被标注烦死的看过来,RynnValue直接用时间戳当监督,不用偏好标注,效果还反超SOTA,成功率涨了20个点。
稍后读 已读 值得跟进 有用 关注 RynnValue
11:54
11:54 官方账号 arXiv cs.AI @Alban Puech, Matteo Mazzonelli, Tamara R. Govindasamy, Mangaliso Mngomezulu, Héctor Maeso-García, Thomas Tolhurst, Javad Bayazi, Ali Moeini, Naomi Simumba, Celia Cintas, David Nelischer, Romeo Kienzler, Jonas Weiss, Anna Varbella, Florian Dörfler, Gabriela Hug, Martin Mevissen, Juan Bernabé-Moreno, François Mirallès, Hendrik F. Hamann, Etienne Vos, Thomas Brunschwiler GENCO(几何神经校正优化器)是一个统一神经求解器,用于稳态输电网分析,涵盖潮流(PF)、最优潮流(OPF)和状态估计(SE)。在PFDelta和OPFData基准上,GENCO在大规模PF中比牛顿-拉夫逊法快30倍,同时匹配DC-PF的功率平衡残差。在OPF中,它比IPOPT快85倍,并提高了可行性和最优性。在SE中,GENCO对噪声和参数误差的鲁棒性优于加权最小二乘法。配套的开源GridFM开发框架和百万级数据集支持可复现的基准测试。 推荐理由: 电力系统工程师看过来:GENCO一个模型搞定潮流、最优潮流和状态估计,比传统求解器快几十倍,还开源了框架和数据集,想上手试试的别错过。
稍后读 已读 值得跟进 有用 关注 GENCO
11:48
11:48 官方账号 arXiv cs.AI @Wanying Qu, Qinghua Mao, Yu Li, Jiyao Liu, Xin Zhang, Dadi Guo, Yanxu Zhu, Qingyu Liu, Leitao Yuan, Xi Lin, Shanfeng Zhu, Yanwei Fu, Jing Shao, Xia Hu, Dongrui Liu SHE框架将智能体安全机制分解为系统提示、规则库、安全记忆和工具策略四个组件,每个组件有明确的安全职责。该框架通过归因引导的进化循环,将轨迹失败转化为结构化诊断,并学习组件特定的边界优化。在Agent-SafetyBench上,SHE相比静态SafeHarness将攻击成功率降低3.1倍,同时提升良性效用。进化后的安全机制在AgentHarm基准上泛化到未见风险,并无需额外进化即可跨智能体模型迁移。 推荐理由: SHE把智能体安全从模型权重扩展到运行框架,分解成四个可独立进化的组件,实测攻击成功率降3.1倍,还能跨模型迁移,搞AI安全的值得看看。
稍后读 已读 值得跟进 有用 关注 SHE
11:46
11:46 官方账号 arXiv cs.AI @Abraham Gonzalez, Raghav Gupta, Akanksha Jain, Hanna Alam, Alexander Novikov, Po-Sen Huang, Matej Balog, Marvin Eisenberger, Sergey Shirobokov, Ngân Vũ, Hank Levy, Borivoje Nikolić, Sagar Karandikar, Martin Dixon, Parthasarathy Ranganathan ArchAgent v2 将自动化微架构搜索扩展到多级数据预取。它引入级联进化搜索,按缓存层级依次进化和冻结预取器,并加入硬件可实现性反馈回路,在进化过程中实时估算硬件规模。在 DPC4 规则下,ArchAgent v2 自动设计的三级预取器比人工设计的冠军方案表现更好,几何平均 IPC 较基线提升 3.8%,较前冠军 BertiGO 提升 0.3%。在低带宽单核配置下,其性能提升达 4.6%,而 BertiGO 仅为 2.6%。 推荐理由: AI 自动设计芯片预取器,居然跑赢了 DPC4 冠军方案,单核低带宽下提速 4.6%,搞硬件架构的值得看看。
稍后读 已读 值得跟进 有用 关注 ArchAgent
11:43
11:43 官方账号 arXiv cs.AI @Mahvish Nagda, Jihyeon Lee, Matthew Thompson, Chunjong Park, Tim Strother, Valentin Liévin, Roma Ruparel, Akshay Goel, Teya Bergamaschi, Suhana Bedi, Meet Shah, Pavel Dubov, Liviu Panait, Toshiyuki Fukuzawa, Sam Schmidgall, Craig Schiff, Joseph Xu, Aliya Rysbek, Yana Lunts, Jan Freyberg, Rebecca Hemengway, Sunny Virmani, David Racz, Carey Radebaugh, Joëlle Barral, Kavi Goel, Dale R. Webster, Katherine Chou, Avinatan Hassidim, Yossi Matias, James Manyika, Gregory Wayne, Tao Tu, Yun Liu, Ethan Goh, Christina Chen, Ryutaro Tanno, Po-Hsuan Cameron Chen, Mike Schaekermann, Anil Palepu 谷歌研究团队推出AMIE(Video),一个基于Gemini的多智能体系统,支持低延迟对话、临床推理和实时视听感知。在包含30名初级保健医生、15名患者演员和100个临床场景的随机OSCE研究中,AMIE(Video)在病史采集、诊断、管理和体格检查方面与医生评分相当或更优。患者演员更偏好AMIE的病情评估和解释方式,但医生在建立融洽关系和伙伴关系上更受青睐。模态消融显示,患者更偏好视频界面而非纯文本聊天。研究指出在精细解剖精度、细微情感表达和高频动作方面仍有局限。 推荐理由: 谷歌把医疗AI做到视频问诊了,AMIE视频版在100个临床场景里和真人医生打平甚至更好,患者还更喜欢它的解释方式,想看看AI看病到底行不行可以读这篇。
稍后读 已读 值得跟进 有用 关注 AMIE
11:24
11:24 官方账号 arXiv cs.AI @Pinzhen Chen, Koel Dutta Chowdhury, Xiaoya Xu, David Tan, Doreen Osmelak, Ona de Gibert, Ariun-Erdene Tumurchuluun, Ashok Urlana, Fedor Sizov, Hale Sirin, Jesujoba Alabi, Karrar Talib Abed, Mateusz Klimaszewski, Nikolay Bogoychev, Niyati Bafna, Patricia Schmidtova, Preksha Manjunath Shanbhag, Sherrie Shen, Vilem Zouhar, Vivek Iyer, Yasser Hamidullah, Yusser Al Ghussin, Zheng Zhao Cultivar 是一个基于 FLORES 的本地化翻译基准,用于评估模型在特定地区文化语境下的翻译能力。该基准通过源语言对比设计,将未本地化版本与本地化版本配对,以检测数据污染和本地化鲁棒性。研究对 32 个开源权重模型进行测试,发现机器翻译专用模型鲁棒性较差,部分模型可能过拟合 FLORES,且模型普遍更擅长翻译美国内容而非其他地区内容。 推荐理由: 想测翻译模型有没有背答案?Cultivar 用本地化对照来抓数据污染,32 个开源模型跑下来,发现 MT 专用模型反而更脆,美国内容翻译得最好。
稍后读 已读 值得跟进 有用 关注 Cultivar
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档 (侧边栏 → AI 日报 → 顶部「往期日报」)。