#多模态
Google 给 Gemini 加了个会说话的表情虚拟形象,对话时口型和表情实时同步,不过现在只有 Enterprise 客户能用。
Perplexity 这个 Portable Computer 能直接操作你连的 Slack、Gmail 和 Google Drive,还全程本地跑、不烧 credits,值得试试。
Xiaomi 新发的 MiMo-V2.6-Pro 在 AA 指数上拿到 46 分,只差 GPT-5.6 一分,成本却只要零头,权重还是 MIT 开源的。
Qwen 搞了三个手机智能体,能跨 App 帮你干活,官方说成功率 90%,比 Apple Intelligence 那种浅整合走得更深。
有人拿牛顿摆实测了 GLM-5.3 和 OpenRouter 上的神秘新模型,物理模拟谁更靠谱一看便知,还有难倒两个模型的翻车场景。
Epoch AI 搞了个叫 FAB 的新基准,让模型看宜家说明书加半成品照片找拼装错误,10 个月内最高分从 28% 冲到 80%。
Meta 把 AI 智能体做成了钥匙扣挂件,带 5G 和 OLED 屏,按指纹就能召唤,12 月假期前发货,先看看长啥样。
Meta 给 Ray-Ban Display 加了语音导航,路线直接叠在镜片画面上,骑车坐公交不用掏手机,还能用 WhatsApp 发全息影像。
AI 眼镜不用联网也能识图问答了,1-bit 量化让 2B 模型塞进眼镜芯片,速度翻倍、功耗还降,端侧玩法的实用参考。
新加坡的 AnyMind 把 Alibaba 的 Qwen 模型接进了自家直播电商平台 AnyLive,做直播带货的可以看看多模型架构怎么落地。
商汤的 SenseNova U1 Pro 图像模型上线了,走交错式思维链生成,最高能出 8K 分辨率图,Raccoon 应用和 API 都能用。
阿里把手机智能体拆成了 Planner、Mobile-Use、Creative 三块再加 OS Harness,荣耀 Magic9 第一家接入,想了解手机 Agent 落地的可以看看。
微软新出的 Ink Canvas,一支 Slim Pen 在画布上手写画图,Copilot 直接接着你的笔记生成文档,Surface Pro 12 英寸还预装。
微软两款 Surface 换上骁龙 X2 Plus,基础内存直接翻倍到 16GB,还带了个手写笔 AI 应用 Ink Canvas,10 月 13 日开卖。
阿里把 Qwen3.8 Max 出了个高吞吐版 Prime,2.4T 参数、1M 上下文还能吃图和视频,已经能在 OpenRouter 直接调了。
Google 新出的 TTS 模型支持 30 秒音频克隆音色,还能让多个角色用不同声音对话,生成 1 分多钟音频只要 2.74 美分。
OpenRouter 让 8 个模型画同一张梗图,还把两个真人用户 P 进去,第二季 B 组投票开始了,去围观哪个模型最有梗。
一次看完五个视觉与 OCR 实战案例:Sarvam 读了 13 万亿 token,Reducto 解析 PDF 能提分省 token,Noyan 花几美元训检测器,做法都够具体。
OpenAI 给 ChatGPT 语音加上了邮件、日历和 Slack 权限,动动嘴就能发邮件、约会议,底层换成了新的 GPT-6 系列模型。
ChatGPT 语音模式升级了,能用日历、Slack 这些插件,还能靠说话直接在浏览器里做文档和表格,今天全球推送。
Google 新出的 Gemini 3.8 Flash TTS 能用一句话描述就造出音色,还能一段剧本生成双人对话,做播客和配音的可以试试。
Google 把加密内存搬到了服务器侧,模型能在云端处理你的私人数据但自己看不了,隐私派和端侧算力的折中方案。
Google 新出的两个 TTS 模型,能自定义音色还能逐行改语气,做播客、配音或者语音 Agent 的可以看看区别在哪。