Qwen 团队把智能体能力扩展到音视频了,Qwen3.8-Omni-Flash 能做视频剪辑和长视频翻译,还配了两个开源框架,做多模态应用可以看看。
Qwen3.8-Omni-Flash 发布,多模态智能体竞速开启
2026年9月26日,AI 领域今日焦点集中在多模态模型、智能体基础设施与训练效率三大方向。Qwen 团队发布 Qwen3.8-Omni-Flash,采用稀疏 MoE 架构,上下文达 100 万 token,可完成视频剪辑与长音频翻译;Salesforce 推出 SFR-AutoR&D 让智能体跑通完整研发流程,pandas 优化最高提速 1.84 倍。基础设施侧,Google 开源 Agent 编排运行时 AX,Docker 联合 Linux Foundation 将 Sandbox Kit v3 推为开放标准,Zuse 把 Claude Code、Codex 等 CLI 编程智能体统一封装。训练与部署方面,AWS 多篇教程覆盖 SageMaker HyperPod 跨区域训练与 MoE 强化学习(吞吐量提升 40%),SkillGym 框架发布 2,756 个可验证训练环境。安全研究 TRACE 揭示策略梯度可重建智能体私有轨迹,值得警惕。
模型发布/更新
5 篇Salesforce Research 搞了个跑研发全流程的智能体系统,代码优化提速最高 1.84 倍,还能自动训练 1T 模型,搞基建的可以看看。
Odyssey 的 Agora-2 能让最多20个人和 AI 进同一个 AI 实时生成的世界,靠看《暗黑破坏神 II》录像学会规则,思路挺特别。
机器人公司 Perceptron 出了个 35B 的第一人称视频模型,MMSearch 上开了搜索工具 F1 直接从 18.2 涨到 54.3,做具身智能的可以看看。
产品发布/更新
5 篇Google 开源了个专门管 Agent 的编排框架 AX,用 YAML 声明任务就能在集群里跑,还支持自然语言生成环境,做 Agent 基建的开发者可以看看。
微软把聊天、写代码和智能体塞进一个 Copilot 里,Code 能直接做内部小应用,Autopilot 还能在你睡觉时替你盯 Teams 干活,企业用户可以留意推送时间。
Docker 把 Agent 权限声明做成了 OCI 镜像标准,权限 diff 能进 PR 审查,还能自动拦住偷偷扩权的版本升级,搞 Agent 工程的都该看看。
Google 把 TPU 送上太空了,太阳能是地面 8 倍,2027 年还要测试卫星激光组网,脑洞很大但逻辑说得通。
一个开源工具把 Claude Code、Codex 这些命令行编程智能体装进一个界面,会话不丢、能挂后台跑、手机审批,比自己开一堆终端省事多了。
行业动态
5 篇马斯克公开了自家集群的 GPU 账本,光 GB300 就要堆到 110 万张,这算力规模可以直接跟 OpenAI、谷歌对表了。
Apollo 首席经济学家的数据,前 10% 客户占走 99.5% 推理支出,头部是平均值的 1791 倍,讲清了 AI 和传统软件商业模式的差别。
Gary Marcus 和 Nate Silver 打起嘴仗了,吵的是现在的大模型到底还算不算"随机鹦鹉",两边观点都挺典型,看看你站谁。
论文研究
3 篇把人类技能攻略变成训练环境喂给模型,微调后 35B 小模型在 SkillsBench 上跑赢了 Claude Sonnet 4.6,方法思路挺有意思。
技巧与观点
3 篇教你用 SageMaker 一键部署阿里开源的 Qwen3-TTS 语音模型,短音频就能克隆音色,还能跨语言保持同一个人声。
AWS 出的实操教程,手把手教你在 HyperPod 上用 SkyRL 给 Qwen3-VL-8B 做 GRPO 多模态训练,最后还能部署 LoRA 推理。
AWS 官方教程,讲怎么用 HyperPod 加 Qumulo 把训练算力和数据分开放在两个 Region,还附了吞吐量对比数据,做大规模训练的可以参考。