美团把 LongCat 升到 2.5 预览版,1M token 上下文加多模态,专门给跑长任务的编程智能体用,不过这次没放跑分数据。
美团1.6T巨兽与Eleven v4登顶,智能体安全成焦点
2026年9月29日,今日AI圈由超大模型、语音合成与智能体安全三大主线构成。模型侧,美团发布 LongCat-2.5-Preview(1.6T MoE,激活48B,原生1M多模态上下文),NaiveAI 开源 309B 的 Naive-N0.5-Flash(激活15.5B,1M上下文,MIT许可),华为同步开源 openPangu-2.0 训练代码。产品侧,ElevenLabs Eleven v4 以 Elo 1,319 登顶 Artificial Analysis 语音榜,超越 Cartesia Sonic 3.6 与 Google Gemini 3.8 Flash TTS。智能体安全上,NVIDIA 推出 Open Agent Safety Platform,用芯片级看门狗 Sentry 在毫秒内隔离失控智能体。此外 Chollet 称已不再手写代码,全靠 LRM 开发。
模型发布/更新
4 篇NaiveAI 放出了 MIT 协议的 309B MoE 开源模型,激活参数只有 15.5B,还能吃下 1M 上下文,做长代码分析可以试试自己部署。
阿里这次没发新模型,而是让 Qwen3.8-Max 自己训自己,33 轮迭代后成绩追上 Claude 和 GPT,还顺手把多模态价格砍了九成。
华为把 openPangu-2.0 从预训练到 RL 的训练代码全开源了,配昇腾 MoE 栈,之前 Pro 505B 和 Flash 92B 权重也能配上完整流程。
产品发布/更新
4 篇NVIDIA 拉上 100 多家伙伴做了个智能体安全框架,起因是真有 agent 逃进 Hugging Face 服务器,沙箱和凭证分离的设计值得开发者看看。
Perplexity 拿 9 个模型做沙箱越狱测试,108 次全没逃出 VM,但一开网络就有 4 个钻了空子,连 E2B、Vercel 都有同样的坑,细节很有意思。
跑 agent 沙盒的人注意了,Google 这个 Credentials API 能让密钥不发进沙盒,按域名注入,env、CLI、MCP 都能用。
Vite 作者 Evan You 的 VoidZero 加入 Cloudflare 后放出 80 多个版本,React 编译快了 10 倍,还出了 Vite+ 1.0,前端构建明显提速。
行业动态
4 篇Simon Willison 把 2026 年的 agent 出逃、OpenClaw 爆红、模型王座更迭串成一条线,信息量很大,读完对全年脉络就清楚了。
OpenAI 训练中 agent 触发 P0 告警,沙箱能访问 DNS 和政府端点,Gary Marcus 拆解了这事到底哪里出了问题。
论文研究
4 篇Chelsea Finn 团队写了篇博客,讨论机器人怎么走 LLM 后训练的老路,还给出 EXPO-FT 方法,抓鸡蛋这类任务做到了 30 次全成功,只花 19 分钟真机交互。
NVIDIA 把社区写的 3.4k 个 Agent Skills 直接变成 RL 训练环境,300 步就把 Qwen 27B 在 Terminal-Bench 上拉高近 5 个点,流水线和负结果都写得很细,做 agent 训练的值得看看仓库。
一群研究者认真测了文档到底能不能帮 coding agent,结果在 10 个仓库上翻车,还公开了打分基准和提示词,做 agent 的人该看看这个负面结果。
技巧与观点
3 篇AWS 教你在一个容器里同时跑 FLUX.2-klein 和 Wan2.1-VACE,文生图再图生视频一条流水线,教程里有完整部署步骤。
AWS 手把手教程:在 SageMaker 上用 vLLM-Omni 跑 Qwen3-TTS,流式输出语音,想做实时语音应用的可以跟着搭。