12:07官方账号arXiv cs.LG@Sandro Kuppel, Julian Hoßbach, Samuel Tovey, Christian Holm该论文提出一种多模态深度学习架构,联合处理原始时间序列、小波图像和静态特征向量,在42肽基准上超越现有方法超过10个百分点。模型在20氨基酸数据集上实现了接近完美的准确率。注意力分析显示时间序列和小波图像输入关注同一事件的不同特征。研究展示了机器学习在纳米孔传感器中实现高精度分子识别的潜力。论文nanoporeTransformer多模态推荐理由:他们用多模态Transformer把纳米孔信号分类精度提升了10个百分点,42肽和20氨基酸两个数据集都表现优异,值得关注。原文稍后读已读值得跟进有用关注 nanopore
11:38官方账号arXiv cs.AI@Xuchen Zhu, Yajuan Wei, Shuang Hao, Jiwei Jiang, Guanxiang Mao, Fang Ren针对 RGB-D 语义分割模型在缺失 RGB 或深度模态时性能骤降的问题,研究者提出 Condition Dropout (ConD) 方法。ConD 在预训练模型基础上增加第二阶段训练,随机模拟完整、缺 RGB 或缺深度输入,冻结原编码器并训练带有零初始化特征注入的副本。在 NYU-Depth V2 和 SUN RGB-D 数据集上,ConD 在缺失模态下显著提升鲁棒性,且完整模态下略有增益。代码将在论文接收后公开。论文ConDNYU-Depth V2SUN RGB-D推荐理由:做语义分割的可以看看 ConD,训练完一个模型就能同时应付缺 RGB 或缺深度的情况,还能保持全模态精度。简单有效,代码也快开源了。原文稍后读已读值得跟进有用关注 ConD
03:09elvis@omarsar0精选Karpathy提出长语音漫谈在多模态下效果更佳。用户分享了一种将长语音笔记、当前屏幕、注释和精确文本打包成单个“task”单元的提示方式。智能体从多个信号中重建意图,大幅减少纠正循环,从而高效交接更大块的工作。该方法适合需要复杂上下文理解的智能体交互场景。技巧Karpathy智能体多模态推荐理由:有人把语音、屏幕和文字打包成一个任务喂给智能体,纠正循环几乎消失,试试这个思路。原文稍后读已读值得跟进有用关注 Karpathy
00:34Poe@poe_platform72°Google DeepMind 的两款新模型 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 已登陆 Poe 平台。Gemini 3.6 Flash 是新一代主力模型,在编码、知识工作、多模态性能上均有增强,并改进了计算机使用能力。Gemini 3.5 Flash-Lite 是 3.5 系列中最快的模型,专为高吞吐、低成本任务和智能体工作流优化。用户现可在 Poe 上直接使用这两个模型。AI模型Gemini 3.6 FlashGemini 3.5 Flash-LiteGoogle DeepMind10 个信源在谈事件专题推荐理由:Poe 上了 Google 最新的 Gemini 3.6 Flash,编码和多模态更强,还有超快且省钱的 Flash-Lite 适合批量任务。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
21:55官方账号阿里通义 Qwen@Alibaba_Qwen阿里通义千问发布 Qwen-Image-3.0 图像生成模型,核心升级在于更准确的细节还原和更深入的领域知识。该模型在报纸 PDF 排版、短剧分镜、复杂 UI 界面等生产力场景中表现突出。据官方透露,这版模型在图文一致性、文字渲染精度上相比前代有显著提升,预计可应用于设计、内容创作、教育、电商等领域的自动化生成。AI模型Qwen-Image-3.0Alibaba图像生成推荐理由:阿里发了 Qwen-Image-3.0,专门优化了报纸编排、分镜和UI这些重度场景,文字和细节比之前强了不少。原文稍后读已读值得跟进有用关注 Qwen-Image-3.0
21:42官方账号阿里通义 Qwen@Alibaba_Qwen精选阿里Qwen的Rich Content能力支持在单张图像内渲染多层嵌套界面,从外到内依次显示VSCode、Qwen Chat、通讯软件和咖啡海报。每个层级保留真实UI风格,形成“画中画中画”的视觉深度。该能力测试模型的语义解构与逻辑嵌套,通过一条指令即可生成。AI模型QwenRich ContentVSCode推荐理由:阿里Qwen新能力Rich Content,一张图能嵌套VSCode、Qwen Chat等四层界面,像套娃一样,考验模型对复杂布局的理解。原文稍后读已读值得跟进有用关注 Qwen
15:57IT之家(博客/媒体)成都市7月22日发布《行动方案》。方案推动整车企业加快L3级以上智能网联汽车整车研发量产。具身智能方面将攻关多模态大模型、空间大模型,研发电子皮肤、灵巧手等部件。新能源方面鼓励能源领域专业大模型创新,建设智能电网。行业智能网联汽车L3级以上具身智能推荐理由:成都出了AI+方案,明确要搞L3+自动驾驶和具身智能机器人,还有新能源,都是硬核方向。原文稍后读已读值得跟进有用关注 智能网联汽车
12:59官方账号arXiv cs.AI@Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch, Srinath Sridhar, Matheus Gadelha论文提出Appearance Pointers,一种紧凑的额外token,用于指导扩散变换器(DiT)在指定空间区域获取正确的纹理、对象身份等外观信息。该方法通过区域对应网络生成token,并用空间聚合机制优化,无需重新训练基础DiT模型即可处理多个区域描述。在多个基准测试上,单模型性能达到或超越针对特定模态的现有方法,实现了首个模态无关的局部多模态控制接口。论文Appearance PointersDiT多模态推荐理由:这篇论文搞了个Appearance Pointers,能让DiT模型精确指定图片不同区域该长什么样,不用重训模型,效果还比那些专门的方法好。原文稍后读已读值得跟进有用关注 Appearance Pointers
12:20量子位@田, 晏林经过10年探索,AI医疗领域从替代医生转向为医院提供增强能力。元医院系统整合多模态数据,帮助医生更快做出诊断,效率提升。该理念已在部分三甲医院试点,医生反馈积极。行业AI医疗元医院医院AI推荐理由:讲清楚了AI医疗怎么真正落地——不是取代医生,而是给医院加buff,看了就知道元医院系统具体强在哪。原文稍后读已读值得跟进有用关注 AI医疗
11:28小互@imxiaohu72°通义发布了图像生成模型Qwen-Image-3.0,支持单条指令生成九张信息图或一整版报纸。该模型原生渲染12国语言,覆盖100+艺术风格,并可仿真网页游戏直播界面。它还能联网获取最新世界知识,指令上限提升至4.5k token,一次交代完整复杂内容。AI模型Qwen-Image-3.0通义图像生成推荐理由:通义新模型Qwen-Image-3.0来了,能一次性画九张信息图甚至整版报纸,支持12国语言和100多种艺术风格,指令上限4.5k token,复杂需求一次搞定。原文稍后读已读值得跟进有用关注 Qwen-Image-3.0
10:12Jerry Liu@jerryjliu0精选对比 Gemini 3.6 Flash 与 Gemini 3.5 Flash Lite 在文档理解上的表现,参照 Gemini 3.5 Flash 和 Gemini 3.1 Flash Lite。3.6 Flash 在图表理解上下降 14%,3.5 Flash Lite 在布局检测提升 11% 但表格倒退约 12%。总体显示后续版本侧重编码与推理,视觉认知能力持平。数据来源 ParseBench。AI模型Gemini 3.6 FlashGemini 3.5 Flash Lite文档理解10 个信源在谈事件专题推荐理由:看看新版 Gemini 在文档理解上表现如何:3.6 Flash 图表降了,3.5 Flash Lite 布局好但表格差,整体视觉变化不大值你关注。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
06:50OpenRouter@OpenRouterAI83°Google推出Gemini 3.6 Flash模型,在编码、知识工作、多模态性能和智能体规划方面有改进。相比Gemini 3.5 Flash,输出token减少17%。OpenRouter已上线该模型。AI模型Gemini 3.6 FlashGoogle多模态10 个信源在谈事件专题推荐理由:Google新模型Gemini 3.6 Flash来了,编码和多模态更强,还省token,比3.5 Flash少17%输出。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
06:02Google AI Developers@googleaidevs74°Vercel 宣布其 AI Gateway 现在支持 Google 的 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 两个模型。开发者可以通过指定模型名称 'google/gemini-3.6-flash' 和 'google/gemini-3.5-flash-lite' 来在 Vercel 平台上调用这些模型。这简化了通过 Vercel 使用 Gemini 模型的流程,无需单独管理 API 密钥或基础设施。这些模型适用于需要低延迟和高效推理的场景。AI产品VercelAI GatewayGemini 3.6 Flash10 个信源在谈事件专题推荐理由:Vercel 把两个新 Gemini 模型加到 AI Gateway 了,开发者可以直接用,省去自己配环境的麻烦,想试试的可以走起。原文稍后读已读值得跟进有用关注 Vercel
03:48elvis@omarsar0精选Andrej Karpathy在推文中分享了一个多模态提示技巧:当用户懒得打字时,可切换至语音输入并进行约10分钟的意识流独白。他观察到LLM能从杂乱语音中重建思路,并以更清晰的形式回应用户的混乱思考。这种方法能提升与模型的理解对齐,减少后续需要修正的内容。Karpathy还建议在开头声明“切换到语音识别,抱歉有错字”以明确模式。技巧Andrej KarpathyLLM语音输入推荐理由:Karpathy教你用语音输入和意识流跟AI聊天,10分钟搞定思路对齐,比打字省力多了。原文稍后读已读值得跟进有用关注 Andrej Karpathy
03:24elvis@omarsar0Andrej Karpathy分享了一个实用工作流:当懒得打字时,切换语音模式,漫谈10分钟(即使语无伦次),LLM能高效还原梳理你的思路,从而改善对齐。转推者指出语音很强,还可结合其他模态(如图像)进行更丰富的提示。该技巧利用语音输入降低“心智融合”门槛,减少后续修正。技巧语音输入多模态提示词工程推荐理由:直接教你怎么用语音跟LLM瞎聊10分钟,它能帮你理清思路,比打字省力多了。原文稍后读已读值得跟进有用关注 语音输入
03:18@koltregaskes@koltregaskes83°Google 已开始对 Gemini 4 进行预训练,但尚未公布 Gemini 3.5 Pro 的时间表。目前 Gemini 3 是 2024 年 12 月发布的版本,其迭代节奏引发外界关注。AI模型Gemini 4Google预训练2 个信源在谈事件专题推荐理由:Google 开始训 Gemini 4 了,但 3.5 还没影,想了解最新模型动态的可以留意。原文稍后读已读值得跟进有用关注 Gemini 4
03:02The Rundown AI@therundownai阿里Qwen发布了Qwen-Image-3.0图像模型,支持4.5k提示词输入上限。模型具备世界知识和多语言长文本渲染能力。目前暂无公开基准成绩,但官方博客展示了单图生成九宫格场景与文字、超真实伪造PDF论文、信息图和肖像照等示例。AI模型QwenQwen-Image-3.0Alibaba推荐理由:阿里新出的Qwen-Image-3.0能一次生成九宫格漫画还能伪造论文PDF,看着挺强,可惜还没跑分。原文稍后读已读值得跟进有用关注 Qwen
01:30官方账号Google DeepMind@GoogleDeepMind72°Google DeepMind 发布 Gemini 3.6 Flash,该模型在生成生产级代码时速度更快且不易陷入循环。同时,它在多模态任务上表现出色,可分析图表、理解文档并起草报告。Gemini 3.6 Flash 已在 Gemini App 中逐步推送,开发者可通过 Antigravity、Google AI Studio 和 Android Studio 获取 API 访问。AI模型Gemini 3.6 FlashGoogle DeepMind代码生成10 个信源在谈事件专题推荐理由:Gemini 3.6 Flash 写代码不卡壳了,还能读图表写报告,开发者可以马上在 Android Studio 里试。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
01:25elvis@omarsar0Claude 桌面应用在 Cowork 模式下新增了“Record a skill”功能。用户通过桌面端 + 菜单选择录制,边录屏边讲解操作步骤,Claude 将屏幕录制和语音转化为可重复执行的技能。此功能支持文本、截图、音频、视频和注释等多模态输入。目前对 Pro、Max 和 Team 计划用户开放。AI产品ClaudeClaude Cowork技能录制3 个信源在谈事件专题推荐理由:Claude 桌面端能学你干活了:录一遍操作,下次它自己就能跑。适合重复性任务,比如自动化流程。原文稍后读已读值得跟进有用关注 Claude
01:15Geek@geekbb78°Google 发布 Gemini 3.6 Flash 和 3.5 Flash Lite 模型。Gemini 3.6 Flash 针对智能体执行和多模态理解优化,在速度与智能间取得平衡。其 API 定价为输入 $1.50/百万 tokens,输出 $7.50。Gemini 3.5 Flash Lite 主打极致低成本和高速吞吐,API 输入仅 $0.30,输出 $2.50。两个模型的知识截止时间为 2026 年 3 月。AI模型Gemini 3.6 FlashGemini 3.5 Flash LiteGoogle10 个信源在谈事件专题推荐理由:Google 新出了 Gemini 3.6 Flash,专门强化了智能体和多模态,适合需要平衡速度和智商的任务;更有便宜的 3.5 Flash Lite 适合大规模调用。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
00:56官方账号Google DeepMind@GoogleDeepMindGoogle DeepMind 正式推出 Gemini 3.6 Flash 和 3.5 Flash-Lite 两个新模型,现已可在 GeminiApp 中体验。开发者可通过 Google AI Studio 和 Android Studio 的 API 直接调用这两个模型进行开发。此外,Gemini 3.5 Flash Cyber 安全版本将作为限量试点计划,通过 CodeMender 平台独家提供。AI模型Gemini 3.6 FlashGemini 3.5 Flash-LiteGoogle DeepMind10 个信源在谈事件专题推荐理由:Google DeepMind 刚发了两个新模型,3.6 Flash 和 3.5 Flash-Lite,现在就能在 GeminiApp 和 API 里用,还有一个安全版要试点,开发者可以试试原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
00:47官方账号Google AI@GoogleAI78°Google AI 发布两款新模型:Gemini 3.6 Flash 在编码、知识工作和多模态任务上比 Gemini 3.5 Flash 更快更准,且显著减少每任务 token 消耗。Gemini 3.5 Flash-Lite 是其 3.5 系列中最快、成本最低的模型,输出速度约 350 token/秒,专为智能体工作流优化,提升了编码和整体质量。两个模型即日起可通过 Gemini API 和 Gemini App 使用。AI模型Gemini 3.6 FlashGemini 3.5 Flash-LiteGoogle AI10 个信源在谈事件专题推荐理由:Google一口气出了两个新模型:3.6 Flash效率更高,3.5 Flash-Lite速度快还便宜,适合做AI智能体。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
00:20岚叔@lufzzlizGoogle 推出了 Gemini 3.6 Flash,这是一款轻量级多模态模型。与此同时,传闻 xAI 的 Grok 4.6 也即将发布。近期模型发布密集,用户表示暂时无法完成全面评测。AI模型Gemini 3.6 FlashGrok 4.6Google10 个信源在谈事件专题推荐理由:Google 刚发的 Gemini 3.6 Flash,轻量多模态,还有 Grok 4.6 的影子,模型党盯紧了。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
00:00官方账号Decoder@Jonathan Kemper阿里Qwen团队发布Qwen-Image-3.0,支持最长4500 token提示词。该模型可渲染小至10像素的清晰文字,原生支持12种语言。它能一次性生成信息图、LaTeX论文和报纸页面等复杂布局。但输出为像素图像而非可编辑格式,实际价值存疑。AI模型Qwen-Image-3.0Alibaba图像生成推荐理由:阿里新出的Qwen-Image-3.0能一次画出信息图,10像素小字也能读,还支持12种语言,挺实用。原文稍后读已读值得跟进有用关注 Qwen-Image-3.0
16:01官方一手Pandaily@contact@pandaily.com (Pandaily)腾讯BAC团队提出ProLaViT框架,用于渐进式潜在视觉思维,使多模态LLM(如Qwen2.5-VL)无需外部视觉工具即可在潜在空间中逐步推理。该框架被ECCV 2026接收,在多个视觉推理基准(如MMMU、MathVista、CLEVR)上相比直接推理方法提升5-15%准确率。ProLaViT通过引入潜在思维令牌,让模型在内部推理步骤中分解复杂视觉问题。AI模型ProLaViT腾讯多模态推荐理由:腾讯发了ProLaViT,让多模态模型像人一样一步步想问题,不用外部工具就能解决视觉推理错误,ECCV 2026保底。原文稍后读已读值得跟进有用关注 ProLaViT
12:27IT之家(博客/媒体)精选小鹏集团发布TuringViT视觉编码器,推出18L和24L两个版本,分别包含15层TLA和20层TLA。在1536×1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍,相比SigLIP2-ViT-L提升2.16倍。该模型仅用0.85B图文对训练,在ImageNet-1K等六项零样本分类基准上取得83.6%平均准确率,超越使用10B数据的SigLIP2-L。TuringViT采用VISTA-Curation数据治理流水线,通过三步筛选优化图文数据质量,并支持四阶段渐进式原生动态分辨率训练。该编码器将应用于小鹏智能驾驶、智能座舱和IRON人形机器人。AI模型TuringViT小鹏视觉编码器推荐理由:小鹏自己搞了个TuringViT视觉编码器,只用了别人十分之一的数据就达到更好效果,还能跑车载和机器人,效率很高。原文稍后读已读值得跟进有用关注 TuringViT
12:09官方账号arXiv cs.LG@Sheng-Yu Wang, Yotam Nitzan, Aaron Hertzmann, Jun-Yan Zhu, Eli Shechtman, Alexei A. Efros, Richard Zhang本文提出TPIPS,一种基于文本提示的图像感知相似度度量,能根据文本条件区分形状、颜色等不同视觉相似性维度。研究基于大规模三元组数据集,包含多种自由形式语义相似性标注。在多个前沿视觉语言模型(VLM)基准测试中,模型与人类一致性差距显著。通过微调VLM,TPIPS在文本引导检索、组合搜索和生成模型细粒度评估中表现更优,且泛化良好。论文TPIPSVLM视觉相似度推荐理由:这篇论文搞了个新度量TPIPS,能按文字指令判断两张图在哪个方面像,比现有单标量打分更细。数据集和模型都开源了。原文稍后读已读值得跟进有用关注 TPIPS
11:57官方账号arXiv cs.LG@Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi ChenFlashRT 是一个引导编码智能体优化实时多模态应用部署的框架,将简单参考实现转化为多 GPU 部署。在 NVIDIA B200 GPU 上,FlashRT 将视频世界模型和多模态 LLM 的延迟降低达 70 倍,吞吐量提升 2.8 倍。在 AMD MI355X GPU 上,延迟降低持平,吞吐量提升达 3.6 倍。针对 Qwen3-Omni 文本到音频推理,FlashRT 在 AMD MI355X 上比专家 vLLM-Omni 实现减少 65% 响应延迟。AI模型FlashRTNVIDIAAMD7 个信源在谈事件专题推荐理由:部署多模态模型时延迟高吞吐低?FlashRT 让智能体自动优化,实测延时降 70 倍,吞吐升 3.6 倍,AMD 平台效果尤其猛。原文稍后读已读值得跟进有用关注 FlashRT
11:25官方账号arXiv cs.AI@Haochen Zhao, Yongxiu Xu, Xinkui Lin, Dong Xie, Jiarui Lu, Yuqi Qian, Yubin Wang, Hongbo Xu, Gaopeng Gou该论文提出SIEVE框架,用于多模态视频虚假信息检测。SIEVE通过一个证据搜寻智能体主动从视频中获取稀疏但关键的线索,构建紧凑的证据包。该智能体通过监督式证据搜寻轨迹和证据感知强化学习进行训练,鼓励获取信息性证据并抑制无效交互。在多个视频虚假信息检测基准上,SIEVE持续优于基线方法,并支持仅用紧凑证据包完成可靠验证。其证据获取过程提供了可检查的轨迹,增强了检测的透明度和可解释性。论文SIEVE多模态虚假信息检测推荐理由:这篇论文提出了SIEVE,用智能体主动找几处关键证据就能判断视频真假,不用看完整个视频,效果更好还更透明。原文稍后读已读值得跟进有用关注 SIEVE
10:54官方账号arXiv cs.AI@Zhanbo Li, Shifeng Wu, Xiangjin Meng, Wenjie Cai精选该论文提出数据优先本体论,将确定性知识移入显式多模态数据库DaoQL。在五个领域的反事实实验(n=1250)中,DaoQL+GPT-4o达到94%可组合反事实分解性,比单独GPT-4o高49个百分点。DaoQL在同机嵌入式设置中报告图BFS为1.20 ms、HNSW为83.1 us、Fluent混合查询为105.8 us。在LDBC SNB SF1和ANN-Benchmarks上实现34/34查询覆盖,ANN-Benchmarks在桥边保护修复后Recall@10>=99%且千级QPS。论文明确区分可证明结构、初步实证证据和架构路线图声明。AI模型DaoQLGPT-4o反事实推理推荐理由:这篇论文把LLM当推理引擎,把知识存进显式数据库DaoQL,反事实推理比GPT-4o单独强49个百分点,适合做高精度场景的参考。原文稍后读已读值得跟进有用关注 DaoQL
10:51官方账号arXiv cs.AI@Zihao He, Hongjie Fang, Shirun Tang, Cewu Lu, Haoshu FangLAG-Fusion提出一种延迟感知指导融合框架,用于异步多模态扩散策略组合。该框架允许不同模态的策略以各自原生推理速率运行,并在可用时贡献去噪指导。通过推导扩散变量在相对动作表征下的参考帧重基规则,实现延迟指导在融合前的对齐。在接触丰富操作任务中,低频视觉策略与高频力觉策略的异质延迟实验显示,LAG-Fusion相比同步融合和专门设计的力感知基线,提升了策略响应速度和任务性能。论文LAG-Fusion多模态扩散策略推荐理由:一篇关于多模态机器人模仿学习的论文,提出LAG-Fusion解决不同传感器速率不同的异步融合问题,实验证明比同步融合更高效。原文稍后读已读值得跟进有用关注 LAG-Fusion
10:41官方账号arXiv cs.AI@Xingjian Tao, Yiwei Wang, Yujun Cai, Jing TangLenGuard-GPC是一种密集奖励框架,针对多视图空间推理中标准GRPO奖励稀疏且无法控制推理长度的问题。它通过比较标准提示与引导提示下token级预测分布的KL散度,提供密集奖励信号。同时引入分阶段长度奖励,将推理长度控制在合理范围,避免简单鼓励短回答。在6项多视图空间推理基准上,LenGuard-GPC相比原始GRPO提升了准确率,同时降低了平均响应长度。论文LenGuard-GPCGRPO空间推理推荐理由:这篇论文用KL散度做密集奖励,还加了长度控制,空间推理上比GRPO更准更短,值得搞强化学习的人看看。原文稍后读已读值得跟进有用关注 LenGuard-GPC
09:33官方账号arXiv cs.LG@Qiwei Han, Chi ZhouChemFusion是一种混合神经网络,融合了传统电子特征与明确的3D原子坐标,通过交叉注意力机制让全局电子状态动态关注未池化分子点云中的空间约束。在多样化交叉偶联反应库上测试,该模型在预测性能上显著超过传统单模态框架。提取注意力矩阵显示,网络自动学习识别并惩罚限制性空间位阻,提供了物理可解释性。论文ChemFusion多模态交叉注意力推荐理由:这篇论文搞了个ChemFusion模型,把电子特征和3D结构结合起来用交叉注意力,预测催化反应产率比老方法准多了。原文稍后读已读值得跟进有用关注 ChemFusion
01:33Hailuo AI@Hailuo_AIMiniMax在7月17-20日上海WAIC 2026展示了其多模态模型阵容。活动包括专家小组和动手工作坊,探讨AI如何推动电影产业从专业制作转向智能创作。参与者体验了端到端的AI创意工作流,涵盖从剧本到成片的完整流程。行业MiniMaxHailuo AI多模态推荐理由:想看MiniMax的多模态模型能干啥?他们在WAIC上展示了AI电影全流程创作,挺有料的。原文稍后读已读值得跟进有用关注 MiniMax
00:51AK@_akhaliqRESOURCE2SKILL是一种新方法,能从人类创建的多模态资源(如视频、截图)自动提取可执行的智能体技能。该方法利用大型语言模型和视觉模型分析资源内容,生成结构化的技能描述。实验在多个基准上显示,蒸馏出的技能使智能体在未见过的任务上成功率提升30%。该方法无需手动标注,可扩展至任意域。论文RESOURCE2SKILL智能体多模态推荐理由:想教AI学新技能又懒得写代码?RESOURCE2SKILL从视频截图里自动学习,省时省力。原文稍后读已读值得跟进有用关注 RESOURCE2SKILL
21:40岚叔@lufzzlizQwen-3.8 Max 参数量2.4T,支持多模态和1M上下文。同任务下速度比Kimi-K3快十倍,对探索性任务性价比高。前端能力与SOTA模型不相上下,限时一折、夜间0.2折。正式版将开源并持续进化,擅长Cowork类Agent任务。AI模型Qwen-3.8-Max阿里推理模型10 个信源在谈事件专题推荐理由:阿里发了Qwen-3.8 Max预览版,参数量2.4T,速度比Kimi-K3快一个数量级,限时一折,正式版很快开源,感兴趣可以试试。原文稍后读已读值得跟进有用关注 Qwen-3.8-Max
15:03IT之家(博客/媒体)精选上海科学智能研究院发布科学多模态基础模型“神珍”(Monkey King Bang, MKB),参数约110亿,覆盖DNA、RNA、蛋白质、小分子、地球系统和医学影像六类科学数据。在20项生物序列任务中,9项取得最优结果,17项位列前二;小分子理解任务SMolInstruct中4项最优。气象预报可滚动生成最长10天的全球气象场,多项指标达到业务级数值预报水平。医学影像分割在9种模态中平均Dice得分为91.20,7种参评方法中最优。AI模型神珍Monkey King Bang上智院推荐理由:上智院开源了110亿参数的科学模型“神珍”,能处理生物序列、小分子、气象和医学影像,在多项基准上领先其他模型。原文稍后读已读值得跟进有用关注 神珍
14:45IT之家(博客/媒体)72°字节跳动 Seed 发布音频创作模型 Seed Audio 1.0,在统一框架下联合建模人声、音效和环境声。支持精细时间控制,一条 prompt 即可按时间线编排对白、音效和环境声。支持 20+ 语种生成,大部分语言 MOS 超 4 分,可用率在多数场景达 90% 以上。已在火山方舟体验中心上线。AI模型Seed Audio 1.0字节跳动火山方舟1 个信源在谈事件专题推荐理由:字节新出的 Seed Audio 1.0 能精细控制声音时间线,还能跨 20 多种语言保持音色一致,音频可用率超 90%,做视频创作很实用。原文稍后读已读值得跟进有用关注 Seed Audio 1.0
10:21官方一手pandaily@contact@pandaily.com (Pandaily)虎牙于WAIC 2026发布VAM 1.0,这是一款实时多模态数字人模型,可通过单张照片生成交互式虚拟人,帧率达36.4fps。VAM 1.0支持实时表情与动作驱动,延迟低于100ms。该模型基于扩散架构,参数规模为2.3B。虎牙声称VAM 1.0在实时数字人生成质量上超越同类方案,且计算成本降低50%。AI模型HuyaVAM 1.0WAIC 2026推荐理由:虎牙搞了个新VAM 1.0,给一张照片就能实时生成能互动的数字人,36.4帧每秒,速度挺快。原文稍后读已读值得跟进有用关注 Huya
09:33官方账号arXiv cs.AI@Jiarui Zhang, Muzi Tao, Shangshang Wang, Ollie Liu, Xuezhe Ma, Willie Neiswanger多模态大模型(MLLM)在主动观察任务上能力缺失。新基准ActiveVision包含17个任务(3个类别),要求模型反复视觉感知而非单次描述。GPT-5.5在最高推理档次上仅解决10.6%的项,11个任务得零分;Claude Fable 5仅3.5%,而三名人类被试平均96.1%。即使让模型编写并运行自己的视觉代码,大部分差距依然存在,因为代码在真实图像上不可靠,且捕捉自身失败需要模型缺乏的主动感知。结果表明当前MLLM缺乏稳健的主动视觉观察能力。AI模型ActiveVisionGPT-5.5Claude Fable 510 个信源在谈事件专题推荐理由:想看最强的AI在实时观察任务上有多弱吗?ActiveVision让GPT-5.5和Claude Fable 5原形毕露,人类碾压它们。原文稍后读已读值得跟进有用关注 ActiveVision