VOL.2026.08.15·214 STORIES·AITOP DAILY

AITOP日报

二〇二六年八月十五日 星期六DAILY · 每早八时
01

模型发布/更新

Model Releases
5

ARIES-Mission2:零样本VLA框架实现大规模无人机任务快速生成

官方一手X·KOLX:arXiv: DeepSeek (@Junhao Wei, Yanxiao Li, Haochen Li, Yifu Zhao, Dexing Yao, Baili Lu, Zikun Li, Yapeng Wang, Sio-Kei Im, Dingcheng Yang, Xu Yang)原文 ↗

ARIES-Mission2是一个零样本视觉-语言-动作(VLA)框架,将视觉语义感知与物理路线优化解耦。它用DeepSeek-V3解析自然语言任务,并用Molmo-7B进行零样本目标定位,再通过地理插值将像素坐标转为GPS航点。在UAV-VLPA-nano-30基准上,该框架的飞行距离为62.43公里,比未优化的VLA基线(79.66公里)缩短21.6%,比人工规划(69.00公里)缩短9.5%。30个任务总耗时575.40秒,平均每任务19.18秒,约为人类专家规划速度的3.6倍。其中TSP求解器每任务仅需0.16秒,而VLM推理占据主要耗时。

Qwen3.8-27B发布:单GPU跑1M上下文,vLLM Day-0支持

官方账号X·KOLX:阿里通义 Qwen (@Alibaba_Qwen)原文 ↗

阿里发布 Qwen3.8-27B,单张 Blackwell GPU 即可部署,原生上下文 262K,可扩展至 1M。模型采用与 2.4T 旗舰相同的混合骨干架构,但为 dense 而非 MoE。vLLM 提供 Day-0 支持,内置 MTP 草稿头,短提示词接受率在 BF16 下为 92.2%、FP8 下为 84.8%。在 NVIDIA GB300 上完成端到端验证,支持 BF16/FP8 TP4 与 NVFP4 TP1,工具调用和 1M 上下文生成均正常。

Intern-S2-Preview:科学智能体基础模型发布

官方账号X·KOLX:arXiv cs.LG (@Lei Bai, Jiaqi Cao, Chiyu Chen, Guanzhou Chen, Kai Chen, Guangran Cheng, Erfei Cui, Xuanlang Dai, Shengyuan Ding, Shangheng Du, Yanhui Duan, Yue Fan, Youqing Fang, Quan Gan, Yuanyuan Gao, Jiaye Ge, Lixin Gu, Yuzhe Gu, Qipeng Guo, Junjun He, Xin Hong, Ming Hu, Zhouqi Hua, Haian Huang, Junhao Huang, Zixian Huang, Minxi Jin, Lingkai Kong, Alexander Lam, Zehao Li, Zonglin Li, Tianhao Liang, Dahua Lin, Junyao Lin, Tianyang Lin, Zhouhan Lin, Jiangning Liu, Jin Liu, Kuikun Liu, Wenran Liu, Yifei Liu, Yuhong Liu, Yuhong Liu, Zhoumianze Liu, Ziyan Liu, Ziyu Liu, Haijun Lv, Han Lv, Chengqi Lyu, Le Ma, Ningsheng Ma, Zerun Ma, Haoyang Peng, Runyu Peng, Jifei Shan, Zixin Shang, Kou Shi, Xiang Shi, Qisheng Su, Xuerui Su, Hao Sun, Xiao Sun, Yanan Sun, Yu Sun, Huanze Tang, Yinghao Tang, Wenhui Tian, Zhongbo Tian, Bingli Wang, Haomin Wang, Jiarui Wang, Jingzhi Wang, Rui Wang, Xiquan Wang, Yi Wang, Zhecan Wang, Ziyi Wang, Zun Wang, Rubin Wei, Lianyi Wu, Wen Wu, Yue Wu, Yuhan Wu, Zhenyu Wu, Zijian Wu, Shuhao Xing, Jun Xu, Xingle Xu, Xuenan Xu, Xiangchao Yan, Ziang Yan, Bowen Yang, Danni Yang, Lin Yang, Zhiqi Yang, Qian Yao, Haochen Ye, Peng Ye, Jinhui Yin, Jiashuo Yu, Dingbo Yuan, Fei Yuan, Yuhang Zang, Bo Zhang, Chao Zhang, Chen Zhang, Hongjie Zhang, Junming Zhang, Wenlong Zhang, Wenwei Zhang, Yiming Zhang, Zhuo Zhang, Ziyang Zhang, Haiteng Zhao, Penghao Zhao, Yibo Zhao, Zhonghan Zhao, Zhihang Zhong, Bowen Zhou, Peiheng Zhou, Xin Zhou, Xinyu Zhou, Yunhua Zhou, Dongsheng Zhu, Yicheng Zou)原文 ↗

Intern-S2-Preview 是一系列面向科学发现的智能体基础模型,支持多模态科学理解、推理、生成和长周期任务。训练流程包含科学多模态预训练、监督微调、多任务强化学习及智能体 RL,并引入部分 rollout、自适应长度正则化等技巧提升稳定性。其中 Intern-S2-Preview-397B 在 SciTS 时间序列基准上取得领先表现,同时其时间序列模块增强了科学信号理解与预测。独立的 Intern-MemDec-4B 扩展将 Biology-Instructions 平均分从 56.92 提升至 60.32,且无需修改冻结的 397B 主干。

02

产品发布/更新

Product
5

DeepSeek Harness发布20小时获8万Star,数据图解插件系统

官方一手X·KOLX:歸藏(guizang.ai) (@op7418)原文 ↗

DeepSeek Harness发布20小时,GitHub星标已超8万。其插件系统与Koishi平台相似度达75%,疑似整体移植。代码分析显示主干PR中21.2%由Codex命名,分支信息中28.2%提到Codex,开发高度依赖AI。项目65天产出84万行代码、超1万commit,测试代码与生产代码比例约1:1。另附88页论文,其中57%篇幅为形式化理论推导。

MARC v1:开源多智能体临床推理框架

官方账号X·KOLX:arXiv cs.AI (@Saisha Shetty, Satvik Tripathi, Austin Lin, Colin Zhao, Theodore Kim, Don Enwerem, Jacinta Arnold, Shahriar Faghani, Tessa S Cook)原文 ↗

MARC v1 是一个面向临床推理的开源多智能体框架,替代单体 LLM 提示方式。框架协调提取、推理、答案生成和评估四类角色智能体,中间输出可追踪,支持分阶段错误归因。Decomposer 模块能从自然语言描述自动生成任务提示,省去手工提示工程。该框架支持 API 和本地 CPU 部署,全部配置通过 YAML 完成。代码已发布在 GitHub 上。

ChatGPT 和 Codex 新增 Computer History:记录操作并生成时间线

X·KOLX:小互 (@imxiaohu)原文 ↗

ChatGPT 和 Codex 新增 Computer History 功能,启用 Computer Use 后记录点击、打字、切换应用等交互事件,不截屏不录音。Computer History 会将操作整理为时间线,并根据重复动作主动建议生成技能和自动化。3 个用例中,用户可查询最后查看的 Google Doc 名称、确认文档是否已分享给 Josh 和 Priya、以及生成上午时间分配回顾。

03

行业动态

Industry
5

中国首款舱驾融合整车智能体芯片地平线星空获头部新能源车企定点

官方IT之家原文 ↗

地平线宣布博泰车联获得国内头部新能源车企定点,将供应基于地平线星空芯片的高端AI座舱方案。该项目是行业首个采用纯国产舱驾一体芯片的高端AI座舱项目定点。地平线星空通过单芯片一体化设计实现算力池化,可缩小约50%车载硬件空间,单车综合硬件成本下降1500至4000元。整车智能化研发交付周期从18个月缩短至8个月,舱驾一体软硬件交付时间缩短56%。芯片支持多模态感知融合和车载本地大模型推理,满足高端车型智能化需求。

04

论文研究

Research
5

Agent驱动设计硬件预取器MoP,性能超人类方案

官方一手X·KOLX:arXiv: DeepSeek (@Xiangfeng Sun, Ceyu Xu, Ningzhi Ai, Zeyu Zhu, Yiyang Yuan, Yuan Xie)原文 ↗

论文提出一种性能异常驱动的自动研究流程,通过反复询问预取器失败原因,迭代构建混合预取器MoP。该流程消耗1.91亿DeepSeek V4 Pro tokens,并自动合成多个专用子预取器。在SPEC CPU2006和SPEC CPU2017上,MoP相比无预取实现61.1%的几何平均IPC加速。相比人类设计的Alecto、Berti和Pythia,MoP分别高出14.5%、21.6%和23.6%。RTL综合显示其占用110KB存储和0.0347平方毫米面积。

Vero基准:AI智能体能否构建形式化验证的软件仓库?

官方账号X·KOLX:arXiv cs.LG (@Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song)原文 ↗

Vero是首个评估仓库级联合实现与证明合成的基准,包含43个多模块实例。实例来自Python、Dafny、Verus和Coq的真实仓库,覆盖密码协议到分布式系统等领域。每个实例基于Lean 4,支持仅证明和代码加证明两种评估模式。最强智能体配置仅完整解决27/43个实例,在最高难度仓库上未闭合任何规格。

TEMPO:跨内存/计算受限场景的专家并行负载均衡

官方一手X·KOLX:arXiv: DeepSeek (@Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song)原文 ↗

论文在专家并行MoE服务中发现,GPU吞吐量并不由token数或激活专家数单独决定:约156-168 token以下是显存权重流主导,以上则按128-tile对M维度取整。据此提出TEMPO调度器,将每批调度建模为固定费用makespan问题,在毫秒级求解;在8卡Testbed A上,相对最优固定基线最多提升15.5%,其余场景差距在1%以内。端到端测试中,Qwen3-235B吞吐提升4-6%、p99延迟降低约15.6%,DeepSeek-V3则未见收益。TEMPO论文强调这是阶段图预测的结果,并非普适胜利。

AaLLM:从拓扑生成到尺寸确定的端到端模拟电路设计框架

官方账号X·KOLX:arXiv cs.AI (@Mohammed Ayman Habib, Rylan Hart, Morteza Fayazi)原文 ↗

AaLLM 是一个开源的端到端多智能体 LLM 工作流,输入规格即可输出网表,同时覆盖拓扑生成和电路尺寸确定。它从论文和教科书中自动构建知识库,并采用 RAG 模型模拟电路设计专家知识。AaLLM 使用设计师、评论家和评估器组成的三智能体反馈系统,减少尺寸迭代次数。生成的创新拓扑在品质因数上与已知拓扑相当,部分电路高出 3 倍。与最先进的多智能体 LLM 管线相比,SPICE 调用次数减少 3-4.5 倍,墙钟时间减少 40 倍。

OmniScientist:全模态全学科AI科学家

官方账号X·KOLX:arXiv cs.AI (@Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu)原文 ↗

OmniScientist是端到端的多模态AI科学家系统,可直接处理图像、信号、音频、视频、3D结构等原始证据。系统由感知层和三个自主智能体(构思、实验、写作)组成,通过代码检查保障新颖性与统计有效性。在覆盖5个学科家族、4类证据的36个真实数据案例中,系统全部完成从原始数据到编译手稿,平均论文得分为6.3。与仅接收预计算标量特征的盲变体相比,直接感知在7个评估维度全部占优,并在85%的成对比较中胜出。

05

技巧与观点

Tips & Takes
5

DeepSeek Harness 把 Prompt 做成运行时,能力模块自带 Prompt 指导

X·KOLX:小互 (@imxiaohu)原文 ↗

DeepSeek Harness 的源码显示,它不再把 Prompt 当作一段 System Prompt,而是做成一个运行时(Runtime),通过 Identity、Persona、Tool Guidance、Runtime Context 等模块动态组装。每个能力(如 shell、filesystem、web)都自带 Tool + Schema + Prompt Guidance,由能力负责者告诉模型怎么用。Prompt 还分了 Global Prompt、Agent Scope、Agent-specific Override 三层,支持继承和覆盖。同时,Runtime Context 与稳定 Prompt 分离,cwd、git 状态等动态信息单独注入,避免频繁修改 System Prompt。作者认为 Tool Schema 本身就是 Prompt Engineering,模型最终看到的是 Instructions、Context、Capabilities 的统一组装。

别分类,让LLM先自由发挥标签再用向量匹配

官方账号官方Simon Willison’s Weblog原文 ↗

Simon Willison的博客有1,856个标签,直接让LLM从中挑选匹配项容易超限。Doug Turnbull提出先让模型自由生成标签,再通过向量嵌入在现有标签库中查找最接近的具体标签。示例提示词展示了如何用家具分类层级结构来引导模型生成形状合理的候选标签。这样既能利用模型对语义的理解,又能保证最终标签来自既定词表。

214
今日事件
58
一手报道
71
新模型
65
信源
AITOP · 编辑系统自动生成