Anthropic 的 Opus 5.5 在编程智能体评测拿第一,三项基准都涨了,价格还降了 20%,不过每任务要烧 13 美元 tokens,用前算算账。
DeepSeek 公开 DSec 平台,单日 300 万智能体沙箱
2026年9月25日,今日AI圈三大焦点:智能体基础设施加速——DeepSeek 公开 DSec 弹性计算平台,单日可创建约 300 万个智能体训练沙箱,峰值并发超 38 万,论文共同作者包括创始人梁文锋;国产与开源硬件比拼——华为发布 Atlas 960E SuperPoD,单集群 4,096 颗 NPU、FP8 算力 8 EFLOPS,摩尔线程 MTT S5000 在具身智能 RL 训练中与主流 GPU 曲线相关性达 r=0.976,inferact 开源 Kimi K3 TPU megakernel 跑出 709 tokens/s;模型能力持续进化——Google 发布 Gemini 3.8 Flash TTS 以 89.5% 登顶发音鲁棒性基准,小米公开 MiMo-V3 核心架构 HySparse2 优化长程 Agent 推理,阿里开源 AI 代码审查工具 OpenCodeReview。
模型发布/更新
5 篇Anthropic 让 950 个 Claude 智能体跑了 21 小时,真在基因数据库里挖出一个类似 CRISPR 的新酶系统,流程用的还是公开发布的 Claude Science 和 Claude Code。
小米把 MiMo-V3 的注意力架构拆开讲了:KV Cache 提前生成、Prefill 少跑一半层数,跑 Agent 时长上下文检索更省更准,细节都在官方这篇说明里。
OpenAI 拿出 1215 段心理对话让各家模型答题,GPT-6 Astra 拿 57.3% 第一,Gemini 2.5 Pro 只有 29.5%,数据集已开放下载。
Kimi K3 在 TPU 上跑到 709 tokens/s,比 GB200 还快,92 个 MoE 层塞进一个 Pallas kernel,做法挺巧,做推理的可以看看。
产品发布/更新
5 篇Huawei 搞了个 4096 卡的 NPU 超级集群,靠 NPO 光互连省了 550 kW 电,做大规模训练的可以看看这套架构。
阿里把内部跑了两年的代码审查工具开源了,用确定性 pipeline 管文件选择,token 消耗只有 Claude Code 的九分之一,还能当插件接进 Cursor。
Anthropic 给 Claude Code 加了云会话,关机也能跑任务,Pro 用户记得 10 月 7 日前去领 100 美元额度
OpenRouter 出了个 Tool Search,函数标成 defer_loading 就能按需加载工具定义,不用每轮都为几百个工具定义付 token,还不加价。
Perplexity 把搜索 API 换成了自家 Rust 写的 Photon 引擎,95% 结果 230 毫秒就回来,做搜索相关应用的可以试试延迟够不够快。
行业动态
4 篇LSTM 和世界模型概念的提出者 Schmidhuber 加入了 Sakana AI 的 RSI Lab,做递归自我改进研究,10 月还要在东京办公开活动。
Epoch AI 给了组狠数字:同性能下 AI 成本每季降 47%,比当年电力便宜 54 倍的速度下滑,值得对比下自己行业的降本曲线。
有篇分析挺有意思:美国医生在 OpenEvidence 上一天查 5 次,比 Google 还高频,这种临床需求数据别的公司拿不到。
论文研究
3 篇Apple 发了一篇联邦学习论文,讲怎么用伪标签在无标注数据上训 ASR 模型,还给了稳定训练的实操配方,做语音方向的可以看看。
DeepSeek 发论文讲了训练智能体的沙箱系统 DSec,一天能跑 300 万个沙箱,并发 38 万,做 RL 训练的可以看看。
技巧与观点
3 篇AWS 出了个现成的 WhisperX 容器,一键部署到 SageMaker 就能拿到带说话人标注的逐词转写,还讲了扩缩和省钱细节。
AWS 出的实操教程,教你用 AgentCore Gateway 加 MCP,让一个智能体安全查询多个账号里的数据,做企业级架构的可以照着搭。
Databricks 出了个可直接导入的 notebook,教你把 Jev 决策模型跑在自家 Serverless GPU 上,SQL 里调 ai_query 就能拿分类和概率分数,换上自己数据就能用。