7月23日
11:38
11:38官方账号arXiv cs.AI@Xuchen Zhu, Yajuan Wei, Shuang Hao, Jiwei Jiang, Guanxiang Mao, Fang Ren
针对 RGB-D 语义分割模型在缺失 RGB 或深度模态时性能骤降的问题,研究者提出 Condition Dropout (ConD) 方法。ConD 在预训练模型基础上增加第二阶段训练,随机模拟完整、缺 RGB 或缺深度输入,冻结原编码器并训练带有零初始化特征注入的副本。在 NYU-Depth V2 和 SUN RGB-D 数据集上,ConD 在缺失模态下显著提升鲁棒性,且完整模态下略有增益。代码将在论文接收后公开。
推荐理由:做语义分割的可以看看 ConD,训练完一个模型就能同时应付缺 RGB 或缺深度的情况,还能保持全模态精度。简单有效,代码也快开源了。
7月22日
21:42
21:42官方账号阿里通义 Qwen@Alibaba_Qwen
精选
阿里Qwen的Rich Content能力支持在单张图像内渲染多层嵌套界面,从外到内依次显示VSCode、Qwen Chat、通讯软件和咖啡海报。每个层级保留真实UI风格,形成“画中画中画”的视觉深度。该能力测试模型的语义解构与逻辑嵌套,通过一条指令即可生成。

推荐理由:阿里Qwen新能力Rich Content,一张图能嵌套VSCode、Qwen Chat等四层界面,像套娃一样,考验模型对复杂布局的理解。
12:59
12:59官方账号arXiv cs.AI@Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch, Srinath Sridhar, Matheus Gadelha
论文提出Appearance Pointers,一种紧凑的额外token,用于指导扩散变换器(DiT)在指定空间区域获取正确的纹理、对象身份等外观信息。该方法通过区域对应网络生成token,并用空间聚合机制优化,无需重新训练基础DiT模型即可处理多个区域描述。在多个基准测试上,单模型性能达到或超越针对特定模态的现有方法,实现了首个模态无关的局部多模态控制接口。
推荐理由:这篇论文搞了个Appearance Pointers,能让DiT模型精确指定图片不同区域该长什么样,不用重训模型,效果还比那些专门的方法好。
12:20
11:28
11:28小互@imxiaohu
72°
通义发布了图像生成模型Qwen-Image-3.0,支持单条指令生成九张信息图或一整版报纸。该模型原生渲染12国语言,覆盖100+艺术风格,并可仿真网页游戏直播界面。它还能联网获取最新世界知识,指令上限提升至4.5k token,一次交代完整复杂内容。
推荐理由:通义新模型Qwen-Image-3.0来了,能一次性画九张信息图甚至整版报纸,支持12国语言和100多种艺术风格,指令上限4.5k token,复杂需求一次搞定。
10:12
06:50
03:18
00:56
00:56官方账号Google DeepMind@GoogleDeepMind
Google DeepMind 正式推出 Gemini 3.6 Flash 和 3.5 Flash-Lite 两个新模型,现已可在 GeminiApp 中体验。开发者可通过 Google AI Studio 和 Android Studio 的 API 直接调用这两个模型进行开发。此外,Gemini 3.5 Flash Cyber 安全版本将作为限量试点计划,通过 CodeMender 平台独家提供。
事件专题

推荐理由:Google DeepMind 刚发了两个新模型,3.6 Flash 和 3.5 Flash-Lite,现在就能在 GeminiApp 和 API 里用,还有一个安全版要试点,开发者可以试试
00:20
00:00
7月21日
12:09
12:09官方账号arXiv cs.LG@Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann, Jun-Yan Zhu, Eli Shechtman, Alexei A. Efros, Richard Zhang
本文提出TPIPS,一种基于文本提示的图像感知相似度度量,能根据文本条件区分形状、颜色等不同视觉相似性维度。研究基于大规模三元组数据集,包含多种自由形式语义相似性标注。在多个前沿视觉语言模型(VLM)基准测试中,模型与人类一致性差距显著。通过微调VLM,TPIPS在文本引导检索、组合搜索和生成模型细粒度评估中表现更优,且泛化良好。
推荐理由:这篇论文搞了个新度量TPIPS,能按文字指令判断两张图在哪个方面像,比现有单标量打分更细。数据集和模型都开源了。
11:57
11:57官方账号arXiv cs.LG@Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen
FlashRT 是一个引导编码智能体优化实时多模态应用部署的框架,将简单参考实现转化为多 GPU 部署。在 NVIDIA B200 GPU 上,FlashRT 将视频世界模型和多模态 LLM 的延迟降低达 70 倍,吞吐量提升 2.8 倍。在 AMD MI355X GPU 上,延迟降低持平,吞吐量提升达 3.6 倍。针对 Qwen3-Omni 文本到音频推理,FlashRT 在 AMD MI355X 上比专家 vLLM-Omni 实现减少 65% 响应延迟。
事件专题

推荐理由:部署多模态模型时延迟高吞吐低?FlashRT 让智能体自动优化,实测延时降 70 倍,吞吐升 3.6 倍,AMD 平台效果尤其猛。
7月20日
21:40
21:40岚叔@lufzzliz
Qwen-3.8 Max 参数量2.4T,支持多模态和1M上下文。同任务下速度比Kimi-K3快十倍,对探索性任务性价比高。前端能力与SOTA模型不相上下,限时一折、夜间0.2折。正式版将开源并持续进化,擅长Cowork类Agent任务。
事件专题

推荐理由:阿里发了Qwen-3.8 Max预览版,参数量2.4T,速度比Kimi-K3快一个数量级,限时一折,正式版很快开源,感兴趣可以试试。
14:45
14:45IT之家博客/媒体
72°
字节跳动 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声。支持精细时间控制,一条 prompt 即可按时间线编排对白、音效和环境声。支持 20+ 语种生成,大部分语言 MOS 超 4 分,可用率在多数场景达 90% 以上。已在火山方舟体验中心上线。
事件专题

推荐理由:字节新出的 Seed Audio 1.0 能精细控制声音时间线,还能跨 20 多种语言保持音色一致,音频可用率超 90%,做视频创作很实用。