00:40elvis@omarsar071°Kimi AI 开源了其最强模型 Kimi K3 的权重和技术报告。K3 是一个 2.8T 参数的 MoE 模型,具备原生视觉理解和 1M token 上下文窗口。新架构使每单位计算智能提升 2.5 倍。此外,Kimi 还开源了高性能注意力内核、MoE 通信库和智能体环境基础设施。模型权重和报告已在 Hugging Face 和 GitHub 公开。AI模型Kimi K3MoE多模态10 个信源在谈事件专题推荐理由:Kimi K3 开源了,2.8T MoE 模型带视觉和超长上下文,还开放了底层工具链,值得研究。原文稍后读已读值得跟进有用关注 Kimi K3
00:18Fireworks AI@FireworksAI_HQ72°Kimi K3 在 Fireworks 平台上线,提供推理和训练服务。这是首个3万亿参数级别的开放前沿模型。它支持1M上下文窗口和原生视觉能力。其推理性能可媲美GPT-4o等顶级闭源模型。服务托管于美国且承诺零数据保留。AI模型Kimi K3Fireworks推理模型10 个信源在谈事件专题推荐理由:Fireworks 上了首个3万亿参数的开放模型 Kimi K3,百万上下文加视觉,推理不输闭源,还零数据保留,上手试试。原文稍后读已读值得跟进有用关注 Kimi K3
12:06IT之家(博客/媒体)小米集团徐洁云透露,上周全球调用量排名前五均为中国AI大模型。其中小米MiMo-V2.5升至第一,周调用量达10.5万亿Token,环比增长12%。该系列于4月23日开启公测,包含MiMo-V2.5、V2.5-Pro、V2.5-TTS Series、V2.5-ASR等版本。此外,小米还对Token Plan定价方案进行了优化。这显示中国AI大模型在全球实际使用中的领先地位。行业小米MiMo-V2.5智能体1 个信源在谈事件专题推荐理由:小米的MiMo-V2.5模型全球调用量冲到第一,一周用了10.5万亿Token,超过了其他国内大模型,说明它实际用的人真多。原文稍后读已读值得跟进有用关注 小米
11:58官方账号arXiv cs.AI@Hai-Long Nguyen, Trung Thanh Nguyen, Lars Holm, Dennis Alveringh, Duc Viet LePRIMS是一种物理感知的多模态Transformer,通过三个模块将物理知识融入表示学习和注意力机制。在五流体基准上,PRIMS达到98.92%平均F1分数,参数量仅0.46M,比最先进Transformer方法缩小14倍。在未见过的温度范围和流速范围分布外偏移下,PRIMS持续优于现有最佳模型,展现出对未训练工况的强鲁棒性。论文PRIMS多模态物理引导推荐理由:PRIMS把物理规则直接写进模型结构,用0.46M参数在5种流体识别上拿到98.92% F1,比大模型小14倍还更抗干扰,适合微流控场景。原文稍后读已读值得跟进有用关注 PRIMS
11:45AI Will@FinanceYF572°Claude Opus 5由Anthropic发布。用户分享了10个应用案例。这些案例展示了Claude Opus 5的多种用途。AI模型Claude Opus 5Anthropic推理模型10 个信源在谈事件专题推荐理由:Anthropic的Claude Opus 5刚出,就有10个酷案例,来看看它到底能干啥。原文稍后读已读值得跟进有用关注 Claude Opus 5
11:41量子位@量子位的朋友们蚂蚁百灵发布了新一代原生混合推理模型Ling-3.0-Flash。该模型在MATH-500和HumanEval基准上取得了领先成绩,推理速度相比上一代有显著提升。它支持文本与代码等多模态输入,已通过百灵开放平台提供API。AI模型Ling-3.0-Flash蚂蚁百灵推理模型推荐理由:蚂蚁百灵出了Ling-3.0-Flash,数学和代码能力强,速度更快,开发者直接调API就能用。原文稍后读已读值得跟进有用关注 Ling-3.0-Flash
10:57官方账号arXiv cs.LG@Marc Girona-Mata, Jakob Gawlikowski, Sumit Goski, Gautier Bardi de Fourtou, Valentin T. Bickel, Ben Moseley, Abigail Calzada-Diaz, Sylvester Kaczmarek, Raúl Ramos-PollánLunarFM是一个多模态基础模型,整合了来自3次月球任务的6种仪器数据,将18个输入通道映射到共享嵌入空间。该模型支持相似性搜索、少样本资源映射、矿物丰度回归和地质单元分类等下游任务。研究提供了从南纬70°到北纬70°的机器学习就绪数据集,以及预训练的多模态掩码自编码器。模型输出768维的月球表面属性表示,代码和数据均已开源。AI模型LunarFM多模态基础模型推荐理由:LunarFM把三个月球任务的六种仪器数据整合成一个模型,能直接做资源识别和地质分类,开源数据集和代码。原文稍后读已读值得跟进有用关注 LunarFM
17:16官方一手marktechpost@Michal SutterInduction Labs 推出 Imagination Models 架构,其候选模型 Photon-1 为稀疏 106B-A5B MoE,仅在未标注动作的原始视频上完成单次预训练。Photon-1 能够模拟桌面操作、玩跳棋,并建模台球物理。该架构挑战了传统需动作标签的预训练范式。AI模型Photon-1Induction Labs世界模型推荐理由:Induction Labs 搞了个新套路:不用动作标签,只看视频就能学会模拟桌面、跳棋和台球物理。106B 参数的 MoE 模型,一次预训练就够了。原文稍后读已读值得跟进有用关注 Photon-1
02:30OpenRouter@OpenRouterAIOpenRouter 平台宣布其模型库已从仅支持 LLM 扩展至包含图像、视频和音频模型。用户可在同一界面浏览所有主流多模态模型,并通过视觉对比功能快速评估模型表现。该平台目前集成了如 DALL-E 3、Stable Diffusion、Runway Gen-3 等热门生成模型,覆盖生成式 AI 的主要模态。AI产品OpenRouter多模态视频生成推荐理由:OpenRouter 把图像、视频、音频模型都聚到一个平台上,还能直接对比效果,省去到处找的时间。原文稍后读已读值得跟进有用关注 OpenRouter
13:11量子位@henryVivix推出首个实时互动模型,采用统一流式架构。单卡视频生成速度突破10000 video tokens/s。该模型打通实时多模态生成全链路,支持视频、图像、音频等模态的实时交互。相比传统非实时方案,延迟降低至毫秒级。AI模型Vivix视频生成多模态推荐理由:Vivix这个新模型单卡就能每秒生成上万视频token,做实时互动视频、多模态聊天特别带劲,比之前那些慢吞吞的方案强多了。原文稍后读已读值得跟进有用关注 Vivix
10:19Gary Marcus@GaryMarcusGary Marcus在X上指出,很多人认为AI可以观看并理解电影,但当他要求提供证据时,对方沉默。Marcus强调,目前没有研究证明AI能以24帧/秒以上速率理解全帧视频。他认为这项能力尚未实现。该帖子引发1410次浏览和13个点赞。行业Gary Marcus视频理解多模态推荐理由:Gary Marcus戳穿了AI能看懂电影的幻觉,问问那些跟风吹的人要证据,结果全哑了。这波打脸值得看。原文稍后读已读值得跟进有用关注 Gary Marcus
07:57官方账号Simon Willison’s Weblog(博客/媒体)78°Anthropic 推出 Claude Opus 5,定价与 Opus 4.8 相同,并保留双倍价格的快速模式。该模型在 Artificial Analysis 排行榜上超越 Claude Fable 5。性能接近 Fable 5 但价格仅为其一半。在 Frontier-Bench 任务中,Opus 5 自主编写计算机视觉流水线,从像素图重建 3D FreeCAD 模型。在发现漏洞方面接近 Mythos 5,但未训练漏洞利用能力。AI模型Claude Opus 5Anthropic推理模型10 个信源在谈事件专题推荐理由:Anthropic 的 Claude Opus 5 性能接近 Fable 5 还便宜一半,能自己写代码做 3D 重建,很强。原文稍后读已读值得跟进有用关注 Claude Opus 5
00:48量子位@思邈合肥一AI独角兽在多模态赛道实现原生全模态新路径。该公司在3个月内累计融资21亿元,投资方包括多家知名机构。其技术特点在于不依赖传统拼接方案,直接处理多模态数据。这笔资金将用于模型研发与商业化落地。行业多模态融资合肥推荐理由:合肥的AI公司3个月融了21亿,做的是原生全模态,跟以前的多模态玩法不一样,值得了解原文稍后读已读值得跟进有用关注 多模态
00:00Milvus@milvusioMilvus团队指出,2026年embedding模型选择更依赖数据形态而非排行榜。对于文本知识库,Qwen3 Embedding、Jina v5 text、BGE-M3、OpenAI text-embedding-3、Voyage、Cohere等密集embedding值得测试。对于PDF、图片、截图、音频、视频,推荐Gemini Embedding 2、Jina v5 omni、Cohere Embed 4、Qwen3-VL-Embedding、Voyage Multimodal等模型。长文档可用Voyage context-4进行上下文化片段嵌入。复杂布局可考虑ColPali风格的多向量检索。基准如MTEB、MMEB、ViDoRe可辅助筛选,但最终验证需用自己的文档和查询。Milvus 2.6新增Text Embedding Function,将嵌入管道移入数据库层。技巧MilvusQwen3 EmbeddingJina v55 个信源在谈事件专题推荐理由:Milvus团队写的实战指南,告诉你不同数据该用哪个embedding模型,还捎带介绍了Milvus 2.6的新功能。原文稍后读已读值得跟进有用关注 Milvus
18:43IT之家(博客/媒体)亚马逊今日升级 Alexa+ AI 助手,支持自然对话、信息记忆和任务执行。Alexa+ 可管理日程、总结邮件、生成播客、控制智能家居,并完成购物、餐厅预订、叫车等日常任务。该助手具备多模态能力(视觉识别、生成式 AI),并与 Uber、OpenTable、Grubhub 等第三方服务打通。Alexa+ 与 200 多家新闻机构合作提供个性化新闻摘要,能在 Echo 音箱、手机等设备间同步上下文。AI产品Alexa+Amazon语音助手推荐理由:亚马逊把 Alexa+ 升级成能帮你订餐叫车买菜的智能管家,还能看图和写东西,和第三方服务直接打通,比以前的语音助手强多了。原文稍后读已读值得跟进有用关注 Alexa+
17:45官方账号阿里云 Alibaba Cloud@alibaba_cloud阿里云发布Token Plan,将文本、图像、视频和音频生成服务整合到一个信用池中,提供统一访问Qwen及第三方领先模型的能力。该计划起价每月4美元,适合小团队简化AI支出。支持Hugging Face等平台的模型接入。AI产品阿里云Token PlanQwen推荐理由:小团队不用买一堆AI工具,阿里云一个Token Plan搞定文本图片视频,每月4美元起,还接入了Qwen和第三方模型。原文稍后读已读值得跟进有用关注 阿里云
16:54宝玉@doteyAI博主@dotey在推文中表示不理解DeepSeek至今不支持多模态。刘江引用梁文锋讲话后给出负面评价。该帖获得10条回复、7个点赞和4459次浏览,反映社区对DeepSeek多模态缺失的关注。行业DeepSeek多模态Coding Agent1 个信源在谈事件专题推荐理由:有人吐槽DeepSeek连多模态都没有,还聊了梁文锋的讲话,挺有意思的八卦。原文稍后读已读值得跟进有用关注 DeepSeek
16:12官方一手Pandaily@contact@pandaily.com (Pandaily)NueroDance在北京活动上发布了ND1000和ND8系列EEG脑电设备,同时推出NeuroAI跨模态数据平台。该平台整合多场景神经数据,定位为超越文本和图像的下一代AI基础设施。NueroDance希望借助神经数据推动AI进入新维度。AI产品NueroDanceND1000ND8推荐理由:NueroDance搞了个脑电硬件加数据平台,想用神经信号训练AI,跟现在纯文本图像的做法不一样。原文稍后读已读值得跟进有用关注 NueroDance
15:26官方账号阿里云 Alibaba Cloud@alibaba_cloud精选在WAIC 2026上,阿里云宣布其数据库产品线(包括PolarDB、AnalyticDB、Lindorm等)向Agentic Database演进。新架构基于LakeBase、多模态记忆和全链路可观测性,旨在打造面向智能体时代的下一代数据平台。该平台将支撑大规模AI应用,实现从服务人到服务智能体的转变。AI产品ApsaraDBPolarDBAnalyticDB推荐理由:阿里云把数据库升级成专门给智能体用的Agentic Database,用多模态记忆和全链路监控,让AI跑得更稳更高效。原文稍后读已读值得跟进有用关注 ApsaraDB
14:52IT之家(博客/媒体)83°Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模态基础模型。该模型基于 Self-Flow 学习框架,同步训练视频、图像和音频。它支持单次生成最长 20 秒视频,并附带原生音频。在 10 秒 720p 带声音视频的人工评测中,FLUX 3 对 Grok Imagine Video 胜率 69%,对 Seedance 2.0 和 Gemini Omni Flash 均为 52%。同时具备图像生成与编辑能力。AI模型FLUX 3Black Forest Labs视频生成8 个信源在谈事件专题推荐理由:FLUX 3 能一次生成20秒带声音的视频,还打败了Grok和Gemini同类模型,值得玩玩。原文稍后读已读值得跟进有用关注 FLUX 3
14:21IT之家(博客/媒体)腾讯宣布混元多模态模型部门与大语言模型部门合并,成立基础模型部,由首席AI科学家姚顺雨管理。7月上线的Hy3大语言模型性能显著强于同尺寸模型,比肩参数规模2-5倍的旗舰模型。发布一周后Hy3总调用量较上一代Hy2增长超68倍,WorkBuddy自选模型中Hy3占比达60%。混元3D世界模型2.0支持文字、图片、视频生成3D世界,社区下载量超300万。混元图像模型3.0在LMArena榜单居国内开源模型第一。行业腾讯混元姚顺雨Hy3推荐理由:腾讯把两个AI团队合并了,统一由姚顺雨管。他们新出的Hy3模型一周调用量涨了68倍,很猛。原文稍后读已读值得跟进有用关注 腾讯混元
13:08Ethan Mollick@emollickGoogle分享了其多模态AI模型Gemini的实际使用数据。数据显示,Gemini在体力劳动相关任务中的实用性可能比预期更高。这些数据来自用户的实际使用情况,为AI应用提供了新的视角。AI产品GeminiGoogle多模态推荐理由:Google发了Gemini真实使用数据,发现它在体力干活上比想象中有用,值得看看。原文稍后读已读值得跟进有用关注 Gemini
12:15shao__meng@shao__meng72°Black Forest Labs 发布 FLUX 3,定位为真实世界模型,统一处理图像、视频、音频三种模态。模型最长生成约20秒带原生音频的视频,支持续写、关键帧、多语言对白。图像合成与编辑功能将在数周后推出,强化复杂 prompt 和文字渲染。动作预测已通过 FLUX-mimic 用于 mimic robotics 和 Audi 场景。AI模型FLUX 3Black Forest Labs多模态8 个信源在谈事件专题推荐理由:FLUX 3 把图像、视频、音频放一起训,还能预测动作。已经能生成20秒带声音的视频,图像也快上了。原文稍后读已读值得跟进有用关注 FLUX 3
12:10官方账号arXiv cs.AI@Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao, Nikhil Singh, Zhou Yu, Jianfeng GaoOpenForgeRL 是一个开源框架,用于端到端训练基于推理 harness(如 Claude Code、Codex)的智能体。它通过轻量级代理记录模型调用作为训练数据,并使用 Kubernetes 编排器在远程容器中执行 rollout。在 ClawEval 上达到 31.7 pass^3 和 55.9 pass@3,在 QwenClawBench 上达到 33.7。GUI 基准测试中,OSWorld-Verified 得分 37.7,Online-Mind2Web 得分 63.0,WebVoyager 得分 72.3。这些结果超越同规模开源基线,在 GUI 场景中甚至匹配或超越数倍大的模型。AI模型OpenForgeRL智能体强化学习推荐理由:想用强化学习训练自己的 Claude Code 智能体?OpenForgeRL 让你在真实 harness 和环境中端到端训练,ClawEval 和 GUI 基准上表现不错,而且开源可用。原文稍后读已读值得跟进有用关注 OpenForgeRL
12:09官方账号arXiv cs.LG@Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang现有视觉语言模型(VLM)在处理3D任务时因缺乏空间理解而表现受限。研究者提出VLM-IE3D框架,通过从RGB视频中学习隐式几何令牌(IGTs)和显式几何令牌(EGTs),增强3D空间感知能力。该框架采用3D感知适配器融合两种几何表示与2D视觉信息,无需额外3D输入。在3D视频检测、3D视觉定位、3D密集描述和空间推理等任务上,VLM-IE3D均取得一致性优越性能。代码和模型已开源。论文VLM-IE3DVLMs3D感知推荐理由:这篇论文搞了个VLM-IE3D,让普通视觉语言模型看RGB视频就能学会3D空间感,不用额外3D设备,而且好几个3D任务都做得更好。原文稍后读已读值得跟进有用关注 VLM-IE3D
11:58官方账号arXiv cs.LG@Dongjie Fu, Di Cao, Xize Cheng, Zihan Zhang, Wenxu Jia, Yifu Chen, Shengpeng Ji, Yu Zhang, Tao JinX$^3$-OPD是一个跨模态策略蒸馏框架,将文本教师模型的推理能力迁移到音频语言学生模型上。训练时学生基于自身声学感知生成推理轨迹,教师用匹配文本和验证答案提供词级指导。框架构建了三层对称语料:文本推理合成语音、复杂声场音频事件推理、含副语言线索的会话推理。在MMSU、MMAU、BIG Bench Audio和MMAR基准上,X$^3$-OPD显著提升了音频推理和思维链质量,且保持了模型在领域偏移下的现有能力。AI模型X$^3$-OPD大型音频语言模型推理蒸馏推荐理由:想提升音频模型的逻辑推理?这个框架用文本教师蒸馏,在MMSU等基准上效果拔群,比纯音频训练强很多。原文稍后读已读值得跟进有用关注 X$^3$-OPD
11:52官方账号arXiv cs.LG@Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao研究提出基于开源LLM的多模态认知障碍检测框架,融合语音音频和转录文本。在ADReSS20和ADReSSo21基准上评估,分类准确率达92.4%。该框架优于单模态基线,并展现出跨数据集泛化能力。无需访问原始敏感数据,保护患者隐私。论文ADReSS20ADReSSo21LLM推荐理由:这篇论文用开源LLM整合语音和文本,在ADReSS20上准确率92.4%,比只用单一模态强多了,且跨数据库也能用。原文稍后读已读值得跟进有用关注 ADReSS20
08:20岚叔@lufzzlizFLUX 3 在自家评测中生成10秒、720p带音频的文生视频,效果与Seedance 2.0打平。该模型支持单次最长20秒的视频生成,涵盖文生视频、图生视频、视频续写、关键帧控制及多语言对白。除媒体生成外,FLUX 3 的底层模型可扩展为机器人动作预测,输出机械臂控制指令。目前处于Early Access阶段,视频生成已开放申请,图像版本数周后推出。AI模型FLUX 3Seedance 2.0视频生成8 个信源在谈事件专题推荐理由:黑森林家的FLUX 3 刚曝光,既能文生视频又能带音效,还和Seedance 2.0打了个平手,甚至能控制机械臂。想尝鲜的可以去申请测试。原文稍后读已读值得跟进有用关注 FLUX 3
07:23berryxia@berryxia83°Black Forest Labs推出FLUX 3,这是一个统一的多模态backbone,同时支持图像生成、视频、原生音频和机器人动作预测。目前视频功能已开放early access,未来将开放模型权重。该模型已与mimic、Audi合作,在真实机器人上运行测试。团队提出物理世界智能与内容创作可共享同一套视觉基础模型。AI模型FLUX 3Black Forest Labs多模态8 个信源在谈事件专题推荐理由:Black Forest Labs的FLUX 3把图像、视频、音频和机器人动作预测塞进一个模型,已经跟真实机器人合作跑起来了。原文稍后读已读值得跟进有用关注 FLUX 3
06:58@koltregaskes@koltregaskesFLUX 3是一个单一模型,同时支持图像、视频、音频生成以及机器人动作预测。其衍生版本FLUX-mimic已在奥迪工厂用于布线、分拣和装配。FLUX 3 Video现已开放早期访问,可加入候补名单。未来数周至数月内将推出原生音频、动作预测、图像生成、快速变体及开放权重骨干。AI模型FLUX 3FLUX-mimicAudi8 个信源在谈事件专题推荐理由:FLUX 3把图、视频、音频、机器人全做到一个模型里了,还已经在奥迪工厂跑起来了,视频版还能抢先体验。原文稍后读已读值得跟进有用关注 FLUX 3
02:15官方账号Decoder@Matthias Bastian73°Black Forest Labs发布Flux 3多模态基础模型,可同时学习图像、视频和音频。该模型能生成最长20秒带原生音频的视频,为该公司首次实现语音与画面同步输出。BFL内部测试显示Flux 3在多项指标上略领先Seedance 2.0,但独立评测尚未公开。公司最终目标构建世界模型,已在机器人任务上测试Flux 3。AI模型Flux 3Black Forest LabsSeedance 2.08 个信源在谈事件专题推荐理由:Black Forest Labs的Flux 3能生成带声音的视频,最长20秒,性能还略超Seedance 2.0,他们想搞世界模型,值得关注。原文稍后读已读值得跟进有用关注 Flux 3
01:22Mustafa Suleyman@mustafasuleyman79°Microsoft在PowerPoint中部署MAI图像模型,相比GPT-Image-2成本降低84%。在OneDrive中,MAI模型提升保存率26%并减少延迟约25%。该模型已成为Bing的默认模型,提供高质量性能。在Dragon Copilot中,转录模型覆盖58种语言,将多语言临床转录错误率减半。此外,GitHub和Excel中也在推进类似改进。AI模型MAIMicrosoftGPT-Image-22 个信源在谈事件专题推荐理由:微软把MAI模型塞进了PPT、OneDrive和Bing,成本降了84%,速度还快了,效果挺猛。原文稍后读已读值得跟进有用关注 MAI
01:18techcrunch@Rebecca BellanRunway通过新推出的开发者平台Runway Dev发布Runway Media Router,该路由器提供API让开发者接入包括图像、视频和音频在内的多种第三方生成模型。此举旨在从单一模型公司转型为生成式媒体的基础设施层,以应对日益拥挤的市场竞争。AI产品RunwayRunway Media RouterRunway Dev推荐理由:想接多家视频、图片生成API但不想一个个对接?Runway新出的Media Router帮你统一调度,省事不少。原文稍后读已读值得跟进有用关注 Runway
00:45berryxia@berryxia开发者将Kimi的MoonViT视觉编码器挂载到GLM 5.2文本模型上,形成可用的视觉版本。该项目开源了NVFP4量化权重,展示了插件式多模态组装的有效性。MoonViT编码器可独立复用,GLM 5.2快速获得看图能力,无需从头联合训练。AI模型KimiGLM 5.2MoonViT推荐理由:有人把Kimi的视觉编码器接到GLM 5.2上,开源了量化权重,让GLM 5.2能看图片了。这种插件式玩法很实用。原文稍后读已读值得跟进有用关注 Kimi
00:35官方一手歸藏(guizang.ai)@op741882°Black Forest Labs 发布 Flux 3 视频生成模型,支持文生视频、图生视频(图片参考或起始帧)、视频参考生成、音频与视频延长、关键帧控制、多语言对话、智能剪辑、文字动画和图像输出。模型为 Flux 3 Dev,目前需申请早期访问,未来几周开放 API,之后开源。Flux 3 具备多种视觉风格和宽高比选择,可将单个片段串联成多镜头序列。AI模型Flux 3Black Forest Labs开源模型8 个信源在谈事件专题推荐理由:Black Forest Labs 开源了 Flux 3,能文生视频、图生视频、视频延长和智能剪辑,功能很全面,还支持多语言和多种视觉风格,值得试试。原文稍后读已读值得跟进有用关注 Flux 3
23:57Justine Moore@venturetwins81°Black Forest Labs 推出 FLUX 3,一个统一多模态模型,支持图像、视频、音频和动作预测。其视频生成能力突出,单次提示即可生成最长20秒的多镜头视频,细节逼真。目前 FLUX 3 Video 已开放早期访问。该模型采用统一架构训练,可扩展至机器人动作预测。AI模型FLUX 3Black Forest Labs视频生成8 个信源在谈事件专题推荐理由:Black Forest Labs 的 FLUX 3 能用一个提示生成20秒多镜头真实视频,还可以做图像、音频和机器人预测,很值得试试。原文稍后读已读值得跟进有用关注 FLUX 3
23:00IT之家(博客/媒体)华为小艺App获11.6.6.300版本升级,小艺Claw接入Kimi K3旗舰模型。Kimi K3拥有2.8万亿参数、100万Tokens上下文,基于混合线性注意力机制构建。小艺深度解题新增图文并茂讲解,翻译支持同声传译实时摘要。小艺Claw获信通院首个终端厂商智能体安全认证。AI产品小艺ClawKimi K3鸿蒙10 个信源在谈事件专题推荐理由:华为把小艺Claw接入了Kimi K3,参数2.8万亿,能处理百万字上下文,视觉理解也强,还能深度解题和同传摘要,体验升级了。原文稍后读已读值得跟进有用关注 小艺Claw
20:22官方一手歸藏(guizang.ai)@op7418黑森林工作室在预告中透露了新一代模型 FLUX 3。该模型支持图像、视频、音频和动作生成,是一个全模态生成模型。单条视频支持一次生成20秒。根据过往规律,该模型可能开源。AI模型FLUX 3黑森林工作室多模态8 个信源在谈事件专题推荐理由:黑森林工作室的 FLUX 3 预告来了,全模态还能一次生成20秒视频,可能开源,老用户该关注了。原文稍后读已读值得跟进有用关注 FLUX 3
12:07官方账号arXiv cs.LG@Sandro Kuppel, Julian Hoßbach, Samuel Tovey, Christian Holm该论文提出一种多模态深度学习架构,联合处理原始时间序列、小波图像和静态特征向量,在42肽基准上超越现有方法超过10个百分点。模型在20氨基酸数据集上实现了接近完美的准确率。注意力分析显示时间序列和小波图像输入关注同一事件的不同特征。研究展示了机器学习在纳米孔传感器中实现高精度分子识别的潜力。论文nanoporeTransformer多模态推荐理由:他们用多模态Transformer把纳米孔信号分类精度提升了10个百分点,42肽和20氨基酸两个数据集都表现优异,值得关注。原文稍后读已读值得跟进有用关注 nanopore
11:38官方账号arXiv cs.AI@Xuchen Zhu, Yajuan Wei, Shuang Hao, Jiwei Jiang, Guanxiang Mao, Fang Ren针对 RGB-D 语义分割模型在缺失 RGB 或深度模态时性能骤降的问题,研究者提出 Condition Dropout (ConD) 方法。ConD 在预训练模型基础上增加第二阶段训练,随机模拟完整、缺 RGB 或缺深度输入,冻结原编码器并训练带有零初始化特征注入的副本。在 NYU-Depth V2 和 SUN RGB-D 数据集上,ConD 在缺失模态下显著提升鲁棒性,且完整模态下略有增益。代码将在论文接收后公开。论文ConDNYU-Depth V2SUN RGB-D推荐理由:做语义分割的可以看看 ConD,训练完一个模型就能同时应付缺 RGB 或缺深度的情况,还能保持全模态精度。简单有效,代码也快开源了。原文稍后读已读值得跟进有用关注 ConD