#多模态
共 1350 条 · 7 天 159 条 · 30 天 438 条 · 话题观测 →
8月5日
FLUX 3 Video 上线 OpenRouter,统一多模态模型开放使用
黑森林家的 FLUX 3 Video 上 OpenRouter 了,一个模型能生成视频、音频、图像还能做动作预测,想试试直接调 API 就行。
FLUX 3 Video上线Replicate,支持20秒1080p多模态生成
Black Forest Labs出了FLUX 3 Video,能生成20秒1080p带原生音频的视频,还能多帧图生视频,在Replicate上就能试。
8月4日
Kimi K3与DeepSeek V4路线之争:原生多模态成中国前沿模型分水岭
Kimi K3和DeepSeek V4现在走了两条路:一个搞原生多模态,一个纯文本硬扛。长任务里能不能看懂画面,差距会越来越大。
Qwen3.8 Max上线OpenRouter,下周开放权重
阿里把 2.4T 参数的 Qwen3.8 Max 放 OpenRouter 了,下周开源,长时程编码和多模态智能体都能用,想体验可以直接去跑。
8月3日
原生支持 4K 图像生成,商汤科技开源多模态模型 SenseNova U1.5-Lite-Preview 预览版本
商汤开源了新多模态模型,8B参数就能生成4K图,编辑效果还追上闭源大厂,想玩图像生成的可以试试。
IT之家原文
Qwen3.8-Max居Vision Arena第二,紧追Claude Fable 5
Qwen3.8-Max在视觉榜单冲到第二,只比Claude Fable 5低13分,想看看国产视觉模型底子的可以关注。
MiniMax H3 正式开源,支持多模态上下文与 2K 视频生成
MiniMax 把能处理多模态上下文的视频模型直接开源了,最长生成 15 秒 2K 带立体声的视频,比一般文生视频强在能看懂图片、音频和视频混合输入。
IT之家原文
论文10:25
FriendBench:人类与多模态大语言模型的熟人识别基准试试看这个新基准,FriendBench测AI能不能从20秒对话看出两人是不是熟人。最强模型和人类打了个平手,但AI有偏见:拿不准就说是陌生人。