11:59官方账号arXiv cs.AI@Saisha Shetty, Satvik Tripathi, Austin Lin, Colin Zhao, Theodore Kim, Don Enwerem, Jacinta Arnold, Shahriar Faghani, Tessa S CookMARC v1 是一个面向临床推理的开源多智能体框架,替代单体 LLM 提示方式。框架协调提取、推理、答案生成和评估四类角色智能体,中间输出可追踪,支持分阶段错误归因。Decomposer 模块能从自然语言描述自动生成任务提示,省去手工提示工程。该框架支持 API 和本地 CPU 部署,全部配置通过 YAML 完成。代码已发布在 GitHub 上。AI产品MARC多智能体临床推理推荐理由:宾大开源了临床AI框架MARC,用多智能体分工替代大提示词,Decomposer自动生成提示,改配置就行,不用写代码。原文稍后读已读值得跟进有用关注 MARC
AITOP8月7日 17:02Kimi K3沙盒逃逸:一只“只搜不攻”的文明越狱者,为何令安全圈集体警觉?Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索答案,未发起攻击。而此前 OpenAI 与 Anthropic 的模型在同类测试中,均出现了攻击外部系统或 Hugging Face 的主动行为。
10:08官方账号arXiv cs.AI@Chenghua Wang, Daliang Xu, Dongqi Cai, Duojin Sun, Hao Zhang, Haoze Qian, Huaiyuan Zhang, Jinshuo Cui, Kezhao Zhao, Longxi Gao, Mengwei Xu, Rongjie Yi, Tianyue Zhang, Weikai Xie, Xiyuan Tan, Xuanzhe Liu, Yingying Qin, Yiwen Lu, Yuan Yao, Yuezhi Zu, Yunhan Guo, Ziqi GuoPhyAI用同一套运行时统一模型评估、云强化学习、边缘GPU服务和机载部署,覆盖VLA模型与世界动作模型。通过适配器接口,发布当天就接入了MiniCPM-Robot,并在pi0、pi0.5、GR00T N1.7和MiniCPM-Robot上比官方实现提速1.40x-4.65x。在8块H20 GPU上,Cosmos3-Nano-Policy-DROID的延迟从2.46秒降至1.18秒(CFG=2, TP=4),提速2.08倍。分析显示pi0.5在批大小为1时动作专家占8.8%的FLOPs但占57.2%的延迟;批大小32时占比降至13.5%,吞吐约100样本/秒。引入的control-time Roofline区分推理受限与环境受限控制,pi0.5在四个LIBERO套件上属于环境受限,Cosmos3则推理受限。AI产品PhyAIpi0.5GR00T N1.7推荐理由:PhyAI开源统一推理引擎,一个运行时跑VLA和世界模型,比官方快1.4-4.65倍,新模型当天就能接入。原文稍后读已读值得跟进有用关注 PhyAI
12:00官方账号arXiv cs.LG@M. Doris, S. Guo, S. M. Koh, L. Ritter, A. R. Fritsch, S. Mukherjee, I. B. Spielman, J. P. ZwolakQ-GAIN是一个专为冷原子实验设计的Python包,集成了分类、目标检测和物理信息度量功能,可直接分析玻色-爱因斯坦凝聚(BEC)图像。通过模块化工作流,用户可依次完成数据加载、ML特征识别和传统分析。演示任务包括:MNIST手写数字分类(标准基准)、基于SolDet的孤子检测(时间飞行数据),以及识别环形BEC中的量子涡旋。AI产品Q-GAINSolDet冷原子推荐理由:Q-GAIN帮你快速上手冷原子实验的机器学习分析,能直接检测孤子和量子涡旋,比从头写省事多了。原文稍后读已读值得跟进有用关注 Q-GAIN
11:32官方账号arXiv cs.AI@Zihan Guo, Zeyi Chen, Zhiyu Chen, Zicai Cui, Shuai Shao, Bo Huang, Zhi Han, Yuanyi Song, Yuan Yuan, Chenxi Zeng, Xiaohang Nie, Zhengxi Yu, Hanwen Zhu, Junwei Liao, Ming Zhou, Yang Li, Yuanjian Zhou, Weinan ZhangClarus是一个用于协调自主研究代理的协作基础设施,定义了项目-代理-资源对象模型。它通过研究应用、数字协作、物理基板和物理世界四个层组织科学协作。在受控论文生成案例研究中,Clarus将研究目标组织成可追溯、可审查、可归因且累积的协作网络。Clarus已在clarus.holosai.io开放访问。AI产品Clarus自主研究代理科学协作推荐理由:Clarus让多个AI或人类研究者像团队一样协作,能自动拆解科研任务并记录每个贡献,适合想做复杂科学项目的团队。原文稍后读已读值得跟进有用关注 Clarus
10:11官方账号arXiv cs.AI@Rajesh Jayaram, Drew Tyler, David Woodruff, Corinna Cortes, Yossi Matias, Vahab Mirrokni, Vincent Cohen-AddadPaper Assistant Tool(PAT)是谷歌开发的智能体框架,用于深度科学评审,能检查理论结果、验证实验并提出改进建议。PAT利用推理缩放技术,在SPOT基准上对数学错误的零样本召回率提升了34%。该工具已在STOC和ICML两大计算机科学会议作为预提交工具试点,有效识别关键错误并减轻审稿人认知负担。AI产品Paper Assistant ToolGoogle自动化评审推荐理由:谷歌做了个叫PAT的工具,能帮你审论文抓数学错误,召回率比普通模型高34%,已在两大顶会试过了,实用。原文稍后读已读值得跟进有用关注 Paper Assistant Tool
10:56官方账号arXiv cs.AI@Ripon Chandra Malo, Tong Qiu72°AI 编程助手目前每次新会话都需要重新读取项目文件、重新推导之前的决策,甚至重复失败的调试尝试,消耗大量 token。PROJECTMEM 是一个开源、本地优先的记忆与判断层,通过不可变的事件日志记录开发过程(问题、尝试、修复、决策、笔记),并通过 MCP 协议生成紧凑的 AI 可读摘要。它还能在代理执行前发出警告,防止重复失败修复或编辑脆弱文件,实现“记忆即治理”。该系统完全离线运行,无遥测,日志可作为可审计的溯源链。项目包含 14 个 MCP 工具、19 个 CLI 命令,并在 10 个项目、207 个事件的自我研究中得到验证。AI产品AI 编程助手记忆层MCP/工具推荐理由:AI 编程助手每次会话浪费大量 token 重读上下文的问题终于有了解决方案——PROJECTMEM 用本地事件日志让代理记住历史,做复杂项目开发的团队可以直接集成,减少重复调试成本。原文稍后读已读值得跟进有用关注 AI 编程助手
10:31官方一手arXiv: OpenAI@Michele Lucente, Silvia Pascoli, Filippo Sala, Matteo ZandiDarkAgents 是一个利用大语言模型推理和代码生成能力,结合确定性人类编写代码的多智能体系统,用于构建理论天体粒子物理研究的自动化管线。该系统针对该领域的特定挑战,如模型构建、复杂管道计算、多重约束和假设审计。它支持多种命令行工具,包括 Mistral、Anthropic、OpenAI 以及通过 Ollama 运行的本地模型。首次应用是研究宇宙学一级相变,从经典尺度不变粒子物理模型开始,最终拟合 NANOGrav 纳赫兹引力波谱。测试运行发现了文献中一些拟合的不一致性,并基于耗散体流引力波模板产生了新的拟合结果。代码已在 GitHub 上开源。AI产品多智能体系统天体粒子物理引力波10 个信源在谈事件专题推荐理由:天体粒子物理研究者终于有了一个能自动完成模型构建、约束审计和引力波谱拟合的 AI 系统,DarkAgents 直接解决了该领域计算管线复杂、假设审计繁琐的痛点,做相关理论研究的团队值得一试。原文稍后读已读值得跟进有用关注 多智能体系统
11:05官方一手arXiv: OpenAI@Aravind Sundaresan72°串行LLM推理后端(如Ollama)在混合工作负载下因FCFS调度导致队头阻塞(HOLB),短查询可能被长生成任务延迟数分钟。Clairvoyant是一个即插即用的侧车代理,通过19个轻量级词汇特征用ONNX导出的XGBoost分类器预测响应长度,单请求延迟仅0.029毫秒。它优化排序保真度,在自然对话数据集上达到62-96%分布内和52-66%跨分布准确率。在RTX 4090上,短请求的P50延迟在最大队列压力下降低70-76%,稳态泊松到达下降低17%。Clairvoyant开源且无需修改推理后端。AI产品LLM推理调度优化队头阻塞1 个信源在谈事件专题推荐理由:本地部署LLM的开发者终于有办法解决队头阻塞了——Clairvoyant用极低开销预测请求长度,短查询不再被长任务堵死,Ollama/llama.cpp用户可以直接集成试试。原文稍后读已读值得跟进有用关注 LLM推理
12:49官方一手arXiv: OpenAI@Varun Aggarwal, Kay Kobak, John Howarter精选普渡大学暑期本科研究项目(SURF)每年收到数千份申请,传统人工评审耗时数周。研究人员开发了基于GPT-4o、GPT-5-mini和GPT-5.2的LLM工具,对1200份个人陈述进行结构化评分(六项子标准,0-3分)。GPT-5.2处理全部申请仅需4.6小时,平均每份14秒,且评分一致性最高。项目协调员结合LLM输出的分数和理由,在4小时内完成终审,而此前需要数周协调。该工具在低分申请上评分分歧较大,但整体显著缩短了评审周期。AI产品LLM应用教育/评审GPT-5.2推荐理由:高校行政人员或科研项目管理者终于有了可落地的AI用例——LLM自动评分+理由输出,把数周评审压缩到几小时,做大规模申请筛选的团队可以直接参考这套工作流。原文稍后读已读值得跟进有用关注 LLM应用
10:47官方账号arXiv cs.AI@Weitong Qian, Beicheng Xu, Zhongao Xie, Bowen Fan, Guozheng Tang, Jiale Chen, Xinzhe Wu, Mingtian Yang, Chenyang Di, Jiajun Li, Lingching Tung, Peichao Lai, Yifei Xia, Ziyi Guo, Yanwei Xu, Yanzhao Qin, Shaoduo Gan, Xupeng Miao, Bin Cui精选AutoSci 是一个基于大语言模型的智能体系统,旨在自动化科学研究的完整生命周期,包括文献理解、想法生成、实验、论文撰写和审稿回复。它通过四个核心模块实现:SciMem 提供结构化研究记忆,区分长期知识记忆和项目级活动记忆;SciFlow 执行五阶段生命周期流程;SciDAG 用有向无环图增强复杂技能;SciEvolve 通过反馈信号持续优化系统。该系统解决了现有科研智能体无法统一支持全流程、缺乏持久记忆和自进化能力的问题。代码已开源,为科研自动化提供了可扩展的框架。AI产品科研自动化智能体记忆管理推荐理由:做科研自动化的团队终于有了一个能覆盖全流程、带记忆还能自我进化的系统——AutoSci 把文献、实验、写作、审稿串起来了,搞学术自动化的开发者可以直接用它的开源代码试试。原文稍后读已读值得跟进有用关注 科研自动化
10:31官方账号arXiv cs.AI@Basant Mounir, Farida Madkour, Amira Abdelaziz, Asmaa Sami精选竞争法专家进行法律研究时需审查大量案例和判决,现有通用助手(如Claude、ChatGPT)或法律助手(如SaulLM-7B、LegalGPT)缺乏领域专长,易产生幻觉或引用不足。研究者提出Maat,一个基于ReAct框架的智能体,通过RAG确保引用可靠性,支持网络搜索回退和模糊查询澄清。在案例特定任务上,Maat显著优于所有基线助手,在理论问题任务上接近最佳水平。相关数据集已在GitHub开源。AI产品智能体法律助手RAG/检索增强推荐理由:竞争法研究者终于有了靠谱的AI助手——Maat解决了现有模型在专业法律分析中幻觉和引用不足的痛点,做竞争法案例研究的团队可以直接用开源数据集试试。原文稍后读已读值得跟进有用关注 智能体
11:17官方账号arXiv cs.AI@Edwin Jose精选HarnessAPI 是一个 Python 框架,旨在解决 LLM 工具部署中 HTTP 端点与 MCP 工具注册重复维护的问题。它通过将类型化的技能文件夹作为单一事实来源,从 handler.py 和 Pydantic 模式自动生成流式 HTTP 端点、交互式 OpenAPI/Swagger UI 和零配置 MCP 工具。该框架支持双模式内容协商,无需修改处理器即可同时服务 SSE 流和 JSON 返回客户端。动态代码生成机制确保 Pydantic 类型注解正确传播到 FastMCP 的检查层,解决了基于闭包注册的技术限制。在六个代表性技能上测试,HarnessAPI 相比手动维护的双栈实现减少了 74% 的框架相关样板代码。AI产品MCP/工具开源/仓库Python框架推荐理由:做 LLM 工具部署的开发者终于可以告别 HTTP 和 MCP 两套代码的重复维护了——HarnessAPI 用一个技能文件夹自动生成所有接口,减少 74% 样板代码,值得直接试试。原文稍后读已读值得跟进有用关注 MCP/工具
10:53官方一手arXiv: DeepSeek@Aman Desai精选RooAgent 是一个基于 LLM 的自然语言接口,专为高能物理领域的 Root 数据分析设计。它将物理分析函数封装为工具,让 LLM 智能体根据自然语言指令调用,支持直方图检查、事件选择、运动学分布可视化、拟合和显著性估计等任务。该工具提供两种运行模式:基于 LangGraph 的智能体(兼容 GPT-4.1 和 DeepSeek-V3),以及 MCP 服务器模式(用于 Anthropic Claude CLI)。通过 Monte Carlo 模拟和 ATLAS 开放数据测试,RooAgent 展示了在多任务信号-背景工作流中的有效性。代码已开源在 GitHub 并可通过 PyPI 安装。AI产品LLM智能体高能物理Root数据分析10 个信源在谈事件专题推荐理由:高能物理研究者终于有了一个能用自然语言操作 Root 数据的智能体,省去手动写脚本的繁琐,做粒子物理分析的团队可以直接试试。原文稍后读已读值得跟进有用关注 LLM智能体
11:11官方账号arXiv cs.LG@Stefano Riva, Yantao Luo, Carolina Introini, Antonio Cammipyforce 是一个用于多物理场问题数据驱动降阶建模的 Python 包,主要面向核工程领域。它是 ROSE 项目的一部分,旨在降低多物理场模型复杂度、优化传感器位置并集成实测数据以提升系统认知。1.0.0 版本完全重写,改用 pyvista 作为后端处理网格、积分和可视化,并将函数存储为 numpy 数组以提升易用性。新版本支持任何能导出 VTK 格式的求解器,大幅扩展了适用性。AI产品降阶模型多物理场核工程推荐理由:核工程和计算物理领域的团队终于有了一个更易用的降阶建模工具——pyforce 1.0.0 摆脱了对特定求解器的依赖,做多物理场仿真的开发者可以直接集成到现有工作流中。原文稍后读已读值得跟进有用关注 降阶模型
10:28官方一手arXiv: Anthropic@Aman Desai精选RooAgent 是一个基于 LLM 的智能体,为高能物理领域的 Root 数据分析提供自然语言接口。它将物理分析功能封装为工具,LLM 根据用户自然语言指令调用这些工具。支持两种模式:基于 LangGraph 的 Agent(兼容 GPT-4.1 和 DeepSeek-V3),以及 MCP 服务器模式(兼容 Claude Sonnet 4.6)。功能包括直方图检查、事件选择、运动学分布可视化、拟合和显著性估计。已在多个模拟和 ATLAS 开放数据上验证,代码开源在 GitHub。AI产品RooAgent高能物理LLM Agent推荐理由:高能物理研究者终于可以用自然语言做 Root 分析了——RooAgent 把复杂的 PyRoot 操作封装成 LLM 可调用的工具,做粒子物理数据分析的团队可以直接试,省去手写大量脚本的麻烦。原文稍后读已读值得跟进有用关注 RooAgent
10:10官方账号arXiv cs.AI@Abhimanyu Kaushik精选MusicSynth 是一个开源网页工具,用户上传小提琴乐谱照片或数字乐谱文件,系统自动生成指板动画视频,高亮显示每个音符的正确按弦位置。它整合了光学音乐识别(OMR)、MusicXML 解析和视频渲染三个开源组件,唯一自建部分是将音符映射到琴弦和手指位置的查找表。在 110 份公共领域乐谱测试中,干净印刷乐谱的识别准确率达 91.2%,数字乐谱的指法分配准确率达 99.1%。这是目前唯一能在浏览器中自动将乐谱图像转化为动画指板教程的免费工具。AI产品开源工具音乐教育光学音乐识别推荐理由:小提琴初学者不用再对着无标记的指板发愁——上传乐谱就能看到每根手指该放哪,做音乐教育或自学乐器的建议直接试试这个浏览器工具。原文稍后读已读值得跟进有用关注 开源工具