Google 新出的 Gemini 3.8 Flash 语音模型,2000 多个音色支持 100 种语言,还能克隆声音,Hume 基准第一名。
#多模态
谷歌新出的两款 TTS 模型能逐行控制台词语气,还能用 30 秒录音复制声音,做播客有声书的朋友可以去 AI Studio 试试。
小米把 MiMo-V2.6 整套开源了,Pro 在智能体基准上打平 Claude Opus 5,本地跑前沿模型的门槛又降了。
OpenRouter 上新了个隐身模型 Space Bunny Alpha,100 万 token 上下文,能吃视频输入,推理速度还能调,快去试试是什么底子。
Latent Space 采访了 Radical Numerics 的 CEO,聊他们怎么用生物思维链和多模态感知做生物防御,还能设计新基因组,思路挺新鲜的。
斑马智能在云栖大会发了端侧模型 AutoOmni 2.0-23B-A3B,参数 23B 只激活 3B,跑在车机这类终端上,关注智能座舱的可以看看。
高通在骁龙峰会上用 ANF 技术给《异环》《崩坏:星穹铁道》这些游戏做了 AI 渲染演示,想在手机上看到类似主机光影效果的可以看看。
腾讯混元的 Hy Image 3.5 preview 上 ComfyUI 了,文字渲染和人物一致性都有提升,玩工作流的可以试试。
理想把车端模型拆成大脑、世界模型和视觉语言三块来做,35B 和 4B 边缘版都给了,做具身智能的可以看看架构思路。
高通给 Adreno GPU 首次加了 AI 专用核心,手游画质增强类似 DLSS 4,还直接支持 UE5 和 Unity,玩手游的可以关注
GPT-6 Sol 已经进 Perplexity 了,还直接是 Computer 里 Light 档的默认模型,想省事的朋友可以直接试试。
OpenAI 上了 GPT-6 Sol 和 Luna,比 5.6 系列更强还便宜一半,用 API 的朋友可以直接看看价格表了。
Anthropic 的 Alex Albert 晒了用 Opus 5.5 加 Blender 一句话生成 1906 年旧金山街景的视频,3D 建模能力确实变强了。
AssemblyAI 的 Universal-3.5 Pro 在 OpenRouter 上线了,19 种语言转文字还能加词级时间戳,9 月 29 日前半价,搞语音的可以去试试。
VPRune 不用训练就能剪掉 LVLM 的视觉 token,FastVLM-1.5B 上高压缩率也掉点少,做端侧部署可以看看。
小米把 MiMo-V2.6 权重全开源了,Pro 在 AA 指数拿 46 分压过 Kimi K3,价格只有海外模型的 1/20。
阿里 Qwen 出了个 7B 的图像模型,生成和编辑一个 checkpoint 搞定,还能塞 10 张参考图,浏览器里就能直接玩。