8月14日
11:59
11:59官方账号arXiv cs.AI@Saisha Shetty, Satvik Tripathi, Austin Lin, Colin Zhao, Theodore Kim, Don Enwerem, Jacinta Arnold, Shahriar Faghani, Tessa S Cook
MARC v1 是一个面向临床推理的开源多智能体框架,替代单体 LLM 提示方式。框架协调提取、推理、答案生成和评估四类角色智能体,中间输出可追踪,支持分阶段错误归因。Decomposer 模块能从自然语言描述自动生成任务提示,省去手工提示工程。该框架支持 API 和本地 CPU 部署,全部配置通过 YAML 完成。代码已发布在 GitHub 上。
推荐理由:宾大开源了临床AI框架MARC,用多智能体分工替代大提示词,Decomposer自动生成提示,改配置就行,不用写代码。
8月5日
10:08
10:08官方账号arXiv cs.AI@Chenghua Wang, Daliang Xu, Dongqi Cai, Duojin Sun, Hao Zhang, Haoze Qian, Huaiyuan Zhang, Jinshuo Cui, Kezhao Zhao, Longxi Gao, Mengwei Xu, Rongjie Yi, Tianyue Zhang, Weikai Xie, Xiyuan Tan, Xuanzhe Liu, Yingying Qin, Yiwen Lu, Yuan Yao, Yuezhi Zu, Yunhan Guo, Ziqi Guo
PhyAI用同一套运行时统一模型评估、云强化学习、边缘GPU服务和机载部署,覆盖VLA模型与世界动作模型。通过适配器接口,发布当天就接入了MiniCPM-Robot,并在pi0、pi0.5、GR00T N1.7和MiniCPM-Robot上比官方实现提速1.40x-4.65x。在8块H20 GPU上,Cosmos3-Nano-Policy-DROID的延迟从2.46秒降至1.18秒(CFG=2, TP=4),提速2.08倍。分析显示pi0.5在批大小为1时动作专家占8.8%的FLOPs但占57.2%的延迟;批大小32时占比降至13.5%,吞吐约100样本/秒。引入的control-time Roofline区分推理受限与环境受限控制,pi0.5在四个LIBERO套件上属于环境受限,Cosmos3则推理受限。
推荐理由:PhyAI开源统一推理引擎,一个运行时跑VLA和世界模型,比官方快1.4-4.65倍,新模型当天就能接入。
7月3日
12:00
12:00官方账号arXiv cs.LG@M. Doris, S. Guo, S. M. Koh, L. Ritter, A. R. Fritsch, S. Mukherjee, I. B. Spielman, J. P. Zwolak
Q-GAIN是一个专为冷原子实验设计的Python包,集成了分类、目标检测和物理信息度量功能,可直接分析玻色-爱因斯坦凝聚(BEC)图像。通过模块化工作流,用户可依次完成数据加载、ML特征识别和传统分析。演示任务包括:MNIST手写数字分类(标准基准)、基于SolDet的孤子检测(时间飞行数据),以及识别环形BEC中的量子涡旋。
推荐理由:Q-GAIN帮你快速上手冷原子实验的机器学习分析,能直接检测孤子和量子涡旋,比从头写省事多了。
6月30日
11:32
11:32官方账号arXiv cs.AI@Zihan Guo, Zeyi Chen, Zhiyu Chen, Zicai Cui, Shuai Shao, Bo Huang, Zhi Han, Yuanyi Song, Yuan Yuan, Chenxi Zeng, Xiaohang Nie, Zhengxi Yu, Hanwen Zhu, Junwei Liao, Ming Zhou, Yang Li, Yuanjian Zhou, Weinan Zhang
Clarus是一个用于协调自主研究代理的协作基础设施,定义了项目-代理-资源对象模型。它通过研究应用、数字协作、物理基板和物理世界四个层组织科学协作。在受控论文生成案例研究中,Clarus将研究目标组织成可追溯、可审查、可归因且累积的协作网络。Clarus已在clarus.holosai.io开放访问。
推荐理由:Clarus让多个AI或人类研究者像团队一样协作,能自动拆解科研任务并记录每个贡献,适合想做复杂科学项目的团队。
6月29日
10:11
10:11官方账号arXiv cs.AI@Rajesh Jayaram, Drew Tyler, David Woodruff, Corinna Cortes, Yossi Matias, Vahab Mirrokni, Vincent Cohen-Addad
Paper Assistant Tool(PAT)是谷歌开发的智能体框架,用于深度科学评审,能检查理论结果、验证实验并提出改进建议。PAT利用推理缩放技术,在SPOT基准上对数学错误的零样本召回率提升了34%。该工具已在STOC和ICML两大计算机科学会议作为预提交工具试点,有效识别关键错误并减轻审稿人认知负担。
推荐理由:谷歌做了个叫PAT的工具,能帮你审论文抓数学错误,召回率比普通模型高34%,已在两大顶会试过了,实用。
6月1日
10:47
10:47官方账号arXiv cs.AI@Weitong Qian, Beicheng Xu, Zhongao Xie, Bowen Fan, Guozheng Tang, Jiale Chen, Xinzhe Wu, Mingtian Yang, Chenyang Di, Jiajun Li, Lingching Tung, Peichao Lai, Yifei Xia, Ziyi Guo, Yanwei Xu, Yanzhao Qin, Shaoduo Gan, Xupeng Miao, Bin Cui
精选
AutoSci 是一个基于大语言模型的智能体系统,旨在自动化科学研究的完整生命周期,包括文献理解、想法生成、实验、论文撰写和审稿回复。它通过四个核心模块实现:SciMem 提供结构化研究记忆,区分长期知识记忆和项目级活动记忆;SciFlow 执行五阶段生命周期流程;SciDAG 用有向无环图增强复杂技能;SciEvolve 通过反馈信号持续优化系统。该系统解决了现有科研智能体无法统一支持全流程、缺乏持久记忆和自进化能力的问题。代码已开源,为科研自动化提供了可扩展的框架。
推荐理由:做科研自动化的团队终于有了一个能覆盖全流程、带记忆还能自我进化的系统——AutoSci 把文献、实验、写作、审稿串起来了,搞学术自动化的开发者可以直接用它的开源代码试试。
5月27日
10:31
10:31官方账号arXiv cs.AI@Basant Mounir, Farida Madkour, Amira Abdelaziz, Asmaa Sami
精选
竞争法专家进行法律研究时需审查大量案例和判决,现有通用助手(如Claude、ChatGPT)或法律助手(如SaulLM-7B、LegalGPT)缺乏领域专长,易产生幻觉或引用不足。研究者提出Maat,一个基于ReAct框架的智能体,通过RAG确保引用可靠性,支持网络搜索回退和模糊查询澄清。在案例特定任务上,Maat显著优于所有基线助手,在理论问题任务上接近最佳水平。相关数据集已在GitHub开源。
推荐理由:竞争法研究者终于有了靠谱的AI助手——Maat解决了现有模型在专业法律分析中幻觉和引用不足的痛点,做竞争法案例研究的团队可以直接用开源数据集试试。
5月19日
11:11
11:11官方账号arXiv cs.LG@Stefano Riva, Yantao Luo, Carolina Introini, Antonio Cammi
pyforce 是一个用于多物理场问题数据驱动降阶建模的 Python 包,主要面向核工程领域。它是 ROSE 项目的一部分,旨在降低多物理场模型复杂度、优化传感器位置并集成实测数据以提升系统认知。1.0.0 版本完全重写,改用 pyvista 作为后端处理网格、积分和可视化,并将函数存储为 numpy 数组以提升易用性。新版本支持任何能导出 VTK 格式的求解器,大幅扩展了适用性。
推荐理由:核工程和计算物理领域的团队终于有了一个更易用的降阶建模工具——pyforce 1.0.0 摆脱了对特定求解器的依赖,做多物理场仿真的开发者可以直接集成到现有工作流中。