#多模态
共 1348 条 · 7 天 158 条 · 30 天 436 条 · 话题观测 →
8月3日
8月2日
8月1日
NVIDIA Spatial-IQ基准:拆解3D计数子任务,提升模型空间推理
NVIDIA搞了个Spatial-IQ基准,把数箱子拆成九个子任务,Qwen2.5-VL练完后准确率从2.9%飙到62.6%,但离人类82.1%还远。
模型02:10
Runway发布Gen-4.5视频生成模型,强调整体一致性与精确指令遵循Runway 出了 Gen-4.5,视频生成更听指令了,还能保持前后镜头一致,现在 OpenRouter 上就能直接调。
7月31日
MiniMax H3 通用多模态视频模型 8 月 3 日开源,最高支持 15s 2K 分辨率
MiniMax H3 8 月 3 日开源,能做 15 秒 2K 音视频,价格只有主流模型的 1/3,看看合不合用。
IT之家原文
MiniMax H3与Midjourney V8.2打造动画UI作品集
Cia0用MiniMax H3加Midjourney V8.2做了个动画版UI作品集,H3能一次生成音频、文字和角色锁定,比SD2省事多了。
论文11:52
Theia:面向无数据蒸馏的Incidents1M大规模多模态描述与自动验证想把纯图片的Incidents1M变成图文对?这篇用Qwen3.5做生成和验证,10万条描述加自动打分,干活靠谱。
Google DeepMind 发布 Gemini Robotics 2 机器人智能模型
Google DeepMind 发了 Gemini Robotics 2 和推理模型 ER 2,让机器人能自行规划、纠错、多机协作,适合关注机器人智能的朋友。
Inkling-Small 发布:276B参数12B活跃,原生推理音频和图像
Thinking Machines 出了个 Inkling-Small,276B 参数量但只激活 12B,能处理音频和图像,性能不打折,适合拿来微调玩。
7月30日
7月29日
论文11:14
ClinPRISM: A Cost-Effective Multimodal LLM Framework for Clinical Time-Series QA这论文搞了个ClinPRISM框架,专门搞定不规则时间序列的医疗问答,只用16个token和0.15秒回答一个问题,比现有大模型省资源还更准。
7月28日
模型19:12
智元WITA-Omni Preview登顶DailyOmni全模态榜单,总分85.21智元发了WITA-Omni Preview,85.21分登顶DailyOmni,比Gemini、千问都强,搞具身智能的多模态模型可以看看
IT之家原文