VOL.2026.06.13·148 STORIES·AITOP DAILY

AITOP日报

二〇二六年六月十三日 星期六DAILY · 每早八时
01

模型发布/更新

Model Releases
5

NVIDIA 发布首个智能体 AI 基准测试 AgentPerf,GB300 NVL72 每兆瓦运行 61.4K 编码智能体

X·KOLX:rohanpaul_ai (@rohanpaul_ai)原文 ↗

NVIDIA 发布了首个智能体 AI 基准测试 AgentPerf 的结果。该基准由 Artificial Analysis 推出,测试系统在保持响应性的同时能并发运行多少个智能体。GB300 NVL72 在最低服务层级达到每兆瓦 61.4K 并发智能体,而 H200 仅为 2.6K,性能提升约 23.6 倍。测试模拟了真实编码智能体路径,涵盖 12 种以上编程语言,请求长度从 5K 到 131K token 不等,平均约 27K token。性能提升得益于 72 块 GPU 通过 NVLink 组成机架级系统,以及优化 MoE 专家分配、通信与计算重叠等软件技术。

02

产品发布/更新

Product
4

Rocket Close用Strands Agents和Amazon Bedrock优化产权运营

X·KOLX:AWS Machine Learning Blog (@Anton Selin)原文 ↗

Rocket Close使用Strands Agents、Amazon Bedrock、Amazon Bedrock Knowledge Bases和MCP工具构建了Supercharger解决方案,用于优化产权运营。该方案通过LLM驱动的智能体自动化处理产权搜索和文档分析,减少了人工操作。Rocket Close在实施后实现了运营效率提升,具体数字未公开。技术栈选择基于Amazon Bedrock的托管服务和MCP工具集成,简化了开发流程。

Fireworks 为 Qwen 推出长时智能体循环支持,262k 上下文

X·KOLX:Fireworks AI (@FireworksAI_HQ)原文 ↗

Fireworks AI 为 Qwen 模型新增长时智能体循环功能,支持观察、推理、编码、执行和验证的重复流程。Qwen 官方演示运行了 11 小时,生成了超过 10,000 行代码并执行了 1,000 多次调用。Fireworks 提供 reasoning_history 参数以跨轮次保留推理上下文,支持按请求切换思考/非思考模式,以及原生图像和文本输入。默认启用 262k 上下文和提示缓存,缓存输入价格为每百万 token 0.10 美元。

03

行业动态

Industry
5

Claude Fable 5 因美国政府指令从 Arena 下架,此前排名第一

X·KOLX:lmarena.ai (@lmarena_ai)原文 ↗

Arena 宣布已移除 Claude Fable 5,原因是 Anthropic 的最新公告和美国政府指令要求暂停访问。Fable 5 在 Agent、Text 和 Code Arena 三项基准中均排名第一,是 Arena 测试过的最强模型,在 Agent Arena 上以最大领先幅度超过 Opus-4.8 和 GPT-5.5。该模型在确认任务成功率和好评/投诉比两项关键信号上表现突出,但可操控性较弱。Arena 表示将在可能时恢复访问并重启社区测试。

Anthropic 从租用云算力转向自建数据中心,规划超 1GW 容量

X·KOLX:rohanpaul_ai (@rohanpaul_ai)原文 ↗

据 The Information 报道,Anthropic 正从租用云算力转向自建数据中心,计划在美国部署超 1GW 容量,Google 可能为其租赁付款提供担保。此前 Anthropic 已通过云服务商承诺超 10GW 服务器租赁,包括与 Google 的 2000 亿美元协议。该公司还锁定了与 Akamai、AWS、CoreWeave 和 Fluidstack 的大额云交易,涵盖 Amazon Trainium 硬件和 500 亿美元 Fluidstack 合作。此外,Anthropic 已签署 SpaceX/xAI 的 Colossus 1 数据中心整租协议,月费 12.5 亿美元,并预留 Colossus II 空间。

04

论文研究

Research
4

Google DeepMind 论文:从 AGI 到 ASI 的四条技术路径

X·KOLX:rohanpaul_ai (@rohanpaul_ai)原文 ↗

Google DeepMind 发布论文《From AGI to ASI》,探讨从通用人工智能(AGI)到超级人工智能(ASI)的四种可能路径:持续扩展计算与模型规模、算法范式突破(超越 Transformer)、递归自我改进(AI 加速 AI 研发)、多智能体集体智能。论文指出,扩展路径可能受限于数据、计算和能源瓶颈;递归改进最不确定,因需真实世界测试和稀缺硬件;多智能体集体智能最被低估,通过专业化与协调可超越单一模型。ASI 可能不是单一事件,而是 AI 辅助创造更好 AI 的加速链。

Nvidia 发布 Cosmos 3:统一语言、图像、视频、音频和动作的物理 AI 世界模型

X·KOLX:rohanpaul_ai (@rohanpaul_ai)原文 ↗

Nvidia 推出 Cosmos 3,一个能够理解、模拟和行动于多种物理 AI 任务的统一模型。它将动作视为世界的一等语言,把语言、图像、视频、音频和动作整合到一个共享系统中。该模型通过动作标记设计,让机器人能连接所见与可能发生的事,并决定下一步行动。论文显示,Cosmos 3 可基于视频推断动作,或与未来场景一同生成动作,从而解决机器人抓取、滑动等物理交互问题。

《Memory》让模型在 session 间积累知识:Sonnet 4.6 停在第1步,Fable 5 达73%覆盖率

X·KOLX:AI Will (@FinanceYF5)原文 ↗

《Memory》方法让模型在多个 session 间积累知识,路径分为失败、调查、验证、提炼规则、查用规则五步。Sonnet 4.6 仅完成第1步(记录失败但不查询);Opus 4.7 可到第3步,但校验覆盖率仅7–33%;Fable 5 能走完全程,验证覆盖率最高达73%。该方法旨在提升模型跨会话知识复用能力。

我国原创RNA编辑技术LEAPER首次用于罕见病DMD临床获积极结果

官方IT之家原文 ↗

北京大学魏文胜团队与昌平实验室在《细胞》发表两项研究,其RNA编辑技术LEAPER首次进入DMD(杜氏肌营养不良症)临床研究。3名患儿接受候选药物LE051治疗后,外显子跳跃水平剂量依赖性提高,肌营养不良蛋白恢复,运动功能持续改善。该技术通过工程化RNA调动内源编辑酶,无需外源蛋白,单次给药在猴模型中维持超一年疗效。LEAPER平台可覆盖约80%的DMD患者,目前未观察到严重不良事件。

05

技巧与观点

Tips & Takes
3
148
今日事件
42
一手报道
41
新模型
49
信源
AITOP · 编辑系统自动生成