#多模态
这篇论文搞了个新任务ICQ,让AI对着人像照片在视频里找人、看行为,还放出1377个视频测试集和75K训练集,开源模型里ISYV-Model效果最好。
这篇论文发了个叫 OmniDecVAEs 的框架,能把几十个传感器数据揉在一起,分类和生成都行,参数才 4.1M,比 Transformer 还准。
字节的Seed模型在OpenRouter上线了,一次能喂30张图加10段视频和10段音频,改视频里的东西很方便。
字节 Seedance 2.5 上线 OpenRouter,一次生成 30 秒带声音视频,支持 50 条参考做长叙事。
有人拿云朵照片同时问 Qwen3.8-Max、Claude Opus 5、Kimi K3、GPT 5.6 Sol,画动物轮廓它没输。
OpenAI 发布了用户报告,说 ChatGPT 有 10 亿人在用,现在大家更多拿它干活,35 岁以上用户涨得最快,图像功能也带动了多媒体使用。
Seedance 2.5 API 来了:30 秒视频直出、50 个素材参考,价格和限时折扣都公布了,做视频生成的可以看。
ElevenLabs 出了新的配音模型 Dubbing v2,能把原声的情感带到别的语言里,做视频本地化的话可以试着用 API 接进自己的流程。
豆包 App 上线了视频通话,能边看视频边提问,认人、读图表都行,延迟低,比 GPT Live 更自然,不用内测直接玩。
想学怎么用Claude Code for web处理带截图的复杂任务?Simon直接把他用的提示词贴出来了,照着试就行。
Video-DR 让 AI 边看视频边上网核实信息,35B 参数干翻 Claude-4.5-Sonnet,还开源了,值得试试。
这篇论文做了个急诊分诊模型,数据残缺时也能给预测打个置信分,拿不准就推迟判断,还用MIMIC-IV-ED实测过,挺实在的。
阿里新出的Qwen-Image-3.0-Pro,生成文字特别清晰,能处理超长提示,一张图0.04美元起,做海报、试卷都合适。