一篇推理系统论文,解决多模态模型 Encode 阶段拖垮 GPU 利用率的问题,goodput 比 vLLM 高 1.7 倍、比 NVIDIA Dynamo 高 4.3 倍,做 MLLM 服务的可以看看。
#多模态
如果你用 GPT-6 Sol 或 Luna 做过视觉任务觉得变差了,现在可以去 API 或 Codex 里重新试试,OpenAI 已把 bug 修好。
微软把 Word、Excel、PowerPoint 直接塞进 Copilot 里,建文件、改文档、分享都能在助手里一站搞定,不用来回切换应用了。
Perceptron 的 Mk1.5 上线 OpenRouter 了,做机器人或物理智能体的可以看看,能直接输出检测框和视频片段,不只是文字回复。
Odyssey 新出的 Agora-2 能让 20 个人和 AI 在同一个实时生成的世界里玩,像 AI 版游戏引擎,多人视角还能互不冲突,做智能体研究的可以看看。
Epoch AI 搞了个新基准,让 AI 看照片对照说明书找宜家家具装错的地方,GPT-6 Astra 拿了 80 分,还顺带测出了各家模型的不同毛病。
OpenAI 的 GPT-6 Astra 看一眼照片就能指出你 IKEA 柜子哪步装错了,准确率 80%,比半年前的 28% 高出不少。
美团放了个 1.6 万亿参数的 MoE 模型,能看图、写代码,还直接兼容 Claude Code,长文档党可以试试。
GPT-6 Astra 打 Minecraft 打到收集烈焰棒和末影珍珠这一步,比之前所有 AI 都远,结果被一只苦力怕清空存档,直播全程挺有意思。
Genspark 把 NVIDIA 的 Nemotron 3 Ultra 和自研 Gen-1 Slides 一起上线了,还宣称价格只有 Opus 5 的 1/17,做幻灯片的可以试试。
Perceptron 新出的 Mk1.5 专门给无人机、机器狗这类设备当大脑,能持续追踪视频里的物体、听懂声音,还会自己派子代理干活,价格也挺便宜。
Google 一口气更新了 3.8 Flash TTS、Live Avatar 和 Notebook 语音聊天,还有个把 TPU 送上太空的卫星计划,一次看全。
美团中秋半夜甩出 LongCat 2.5 预览版,16T 参数只激活 48,还有 1M 上下文和原生多模态,参数配置看着很猛,可以蹲一下实测成绩。
Qwen 团队把智能体能力扩展到音视频了,Qwen3.8-Omni-Flash 能做视频剪辑和长视频翻译,还配了两个开源框架,做多模态应用可以看看。
AWS 出的实操教程,手把手教你在 HyperPod 上用 SkyRL 给 Qwen3-VL-8B 做 GRPO 多模态训练,最后还能部署 LoRA 推理。
机器人公司 Perceptron 出了个 35B 的第一人称视频模型,MMSearch 上开了搜索工具 F1 直接从 18.2 涨到 54.3,做具身智能的可以看看。
有人用手机上的 Claude Code 让 Claude Opus 5.5 独立做了个 5 分钟的 UMAP 算法讲解动画,旁白和视觉全是模型自己想的,效果可以直接看。
Google 刚发了两个 TTS 模型,能用 30 秒音频克隆音色、支持 100 多种语言,做游戏配音或有声书可以试试
让 Opus 5.5 设计了一个真乐高能拼的 Microduck,1113 块零件零碰撞,还自动生成 237 步说明书并备好 BrickLink 订单,挺离谱的。
Odyssey 的 Agora-2 能让最多20个人和 AI 进同一个 AI 实时生成的世界,靠看《暗黑破坏神 II》录像学会规则,思路挺特别。
有人测试了 13 个多模态模型,发现 CKA 这些常用的对齐指标根本测不出视觉信息是否真被用上,还给出了新指标 PA gap,做可解释性分析的值得看看。
谷歌给 Gemini 3.8 Live 加了虚拟人功能,能实时唇形同步、切换 97 种语言,做客服虚拟形象的企业可以直接看 API 文档上手了。
Meta 把游戏开发搬到手机上了:输入提示词就能生成游戏雏形,做完直接在 Instagram 信息流里开玩,连下载都省了。
Liquid AI 出了个 DSpark 加速器,16GB 的 Mac 就能跑 LFM2.5-VL-3B,M5 芯片上解码快最多 3.13 倍,输出还不变。