#多模态
Black Forest Labs 开源了 Flux 3,能文生视频、图生视频、视频延长和智能剪辑,功能很全面,还支持多语言和多种视觉风格,值得试试。
做语义分割的可以看看 ConD,训练完一个模型就能同时应付缺 RGB 或缺深度的情况,还能保持全模态精度。简单有效,代码也快开源了。
Poe 上了 Google 最新的 Gemini 3.6 Flash,编码和多模态更强,还有超快且省钱的 Flash-Lite 适合批量任务。
阿里Qwen新能力Rich Content,一张图能嵌套VSCode、Qwen Chat等四层界面,像套娃一样,考验模型对复杂布局的理解。
这篇论文搞了个Appearance Pointers,能让DiT模型精确指定图片不同区域该长什么样,不用重训模型,效果还比那些专门的方法好。
通义新模型Qwen-Image-3.0来了,能一次性画九张信息图甚至整版报纸,支持12国语言和100多种艺术风格,指令上限4.5k token,复杂需求一次搞定。
看看新版 Gemini 在文档理解上表现如何:3.6 Flash 图表降了,3.5 Flash Lite 布局好但表格差,整体视觉变化不大值你关注。
Google新模型Gemini 3.6 Flash来了,编码和多模态更强,还省token,比3.5 Flash少17%输出。
Vercel 把两个新 Gemini 模型加到 AI Gateway 了,开发者可以直接用,省去自己配环境的麻烦,想试试的可以走起。
Gemini 3.6 Flash 写代码不卡壳了,还能读图表写报告,开发者可以马上在 Android Studio 里试。
Google 新出了 Gemini 3.6 Flash,专门强化了智能体和多模态,适合需要平衡速度和智商的任务;更有便宜的 3.5 Flash Lite 适合大规模调用。
Google DeepMind 刚发了两个新模型,3.6 Flash 和 3.5 Flash-Lite,现在就能在 GeminiApp 和 API 里用,还有一个安全版要试点,开发者可以试试
Google一口气出了两个新模型:3.6 Flash效率更高,3.5 Flash-Lite速度快还便宜,适合做AI智能体。
一篇关于多模态机器人模仿学习的论文,提出LAG-Fusion解决不同传感器速率不同的异步融合问题,实验证明比同步融合更高效。