10:17
10:17
官方账号arXiv cs.AI@Jihao Liu, Guoxiong Gao, Zeming Sun, Bin Wu, Shurui Liu, Jiedong Jiang, Haocheng Ju, Leheng Chen, Ronnie Cheng, Xiping Zhang, Bin Dong Danus是一个基于事实图记忆的协调系统,旨在提升研究级数学推理能力。系统包含一个主智能体进行规划和协调,多个工作智能体并行执行证明搜索,以及一个无状态验证器检查数学主张。每个验证的事实连同证明和逻辑依赖存储在事实图中,构建递增的长期论证。在代数几何、奇点理论和组合学的六个研究级案例中,Danus成功生成长而详细的数学证明。
推荐理由:看看Danus怎么用事实图记忆帮多个推理智能体协作解数学难题,还能和数学家互动。
10:17
10:17
官方账号arXiv cs.AI@Yufan Wang, Anit Kumar Sahu, Yan Fei Ng, Daniel Kang, Shayan Vassef, Soorya Ram Shimgekar, Koustuv Saha, Piyum Zonooz, Navin Kumar, Chee Leong Cheng, Li Yan Khor 新加坡数据显示约31%人口有幽门螺杆菌感染证据。研究者使用Nimblemind多智能体系统(nMAS)处理54份去标识化胃活检病理报告,评估4个临床二元字段(胃活检、活检状态、H. pylori阳性、H. pylori相关胃炎)。在216个特征-案例决策中,nMAS正确分类213个(98.61%准确率),与UMA-style MiniMax M2.5对比表现相似,但nMAS提供统一报告级输出与支持源句。假设人工审查每份5分钟,nMAS每份5秒,1000份报告处理时间可从83.3小时降至1.4小时,节省约6100美元。
推荐理由:这篇论文展示了一个能精准从病理文本中抓取H. pylori证据的多智能体系统,准确率98.61%,比人工快几十倍,适合医疗信息提取场景。
10:16
10:16
官方账号arXiv cs.AI@Xinyuan Chen, Haoyu Guo, Shi Guo, Bingqi Jiang, Chunhua Shen, Xing Shen, Tianfan Xue, Yufei Xue, Mulin Yu, Weinan Zhang, Bin Zhao, Bowen Zhou, Ming Zhou 一篇视角文章提出了世界模型的科学定义和分阶段路线图,涵盖从基于模型的强化学习、视频生成到具身机器人和物理AI等子领域。文章指出当前对世界模型缺乏共识,并讨论了关键技术方面,包括预测内容与构建方法。它为不同研究方向的世界模型开发提供了系统性框架。
推荐理由:这篇给了世界模型的具体定义和路线图,适合想了解它在强化学习、视频生成、机器人等领域不同玩法的人。
仅展示最近 2000 条内容。更早的内容请查阅 AI 日报存档(侧边栏 → AI 日报 → 顶部「往期日报」)。