7月27日
11:58
11:58官方账号arXiv cs.AI@Hai-Long Nguyen, Trung Thanh Nguyen, Lars Holm, Dennis Alveringh, Duc Viet Le
PRIMS是一种物理感知的多模态Transformer,通过三个模块将物理知识融入表示学习和注意力机制。在五流体基准上,PRIMS达到98.92%平均F1分数,参数量仅0.46M,比最先进Transformer方法缩小14倍。在未见过的温度范围和流速范围分布外偏移下,PRIMS持续优于现有最佳模型,展现出对未训练工况的强鲁棒性。
推荐理由:PRIMS把物理规则直接写进模型结构,用0.46M参数在5种流体识别上拿到98.92% F1,比大模型小14倍还更抗干扰,适合微流控场景。
11:45
11:41
11:41量子位@量子位的朋友们
蚂蚁百灵发布了新一代原生混合推理模型Ling-3.0-Flash。该模型在MATH-500和HumanEval基准上取得了领先成绩,推理速度相比上一代有显著提升。它支持文本与代码等多模态输入,已通过百灵开放平台提供API。
推荐理由:蚂蚁百灵出了Ling-3.0-Flash,数学和代码能力强,速度更快,开发者直接调API就能用。
10:57
10:57官方账号arXiv cs.LG@Marc Girona-Mata, Jakob Gawlikowski, Sumit Goski, Gautier Bardi de Fourtou, Valentin T. Bickel, Ben Moseley, Abigail Calzada-Diaz, Sylvester Kaczmarek, Raúl Ramos-Pollán
LunarFM是一个多模态基础模型,整合了来自3次月球任务的6种仪器数据,将18个输入通道映射到共享嵌入空间。该模型支持相似性搜索、少样本资源映射、矿物丰度回归和地质单元分类等下游任务。研究提供了从南纬70°到北纬70°的机器学习就绪数据集,以及预训练的多模态掩码自编码器。模型输出768维的月球表面属性表示,代码和数据均已开源。
推荐理由:LunarFM把三个月球任务的六种仪器数据整合成一个模型,能直接做资源识别和地质分类,开源数据集和代码。
7月26日
17:16
17:16官方一手marktechpost@Michal Sutter
Induction Labs 推出 Imagination Models 架构,其候选模型 Photon-1 为稀疏 106B-A5B MoE,仅在未标注动作的原始视频上完成单次预训练。Photon-1 能够模拟桌面操作、玩跳棋,并建模台球物理。该架构挑战了传统需动作标签的预训练范式。
推荐理由:Induction Labs 搞了个新套路:不用动作标签,只看视频就能学会模拟桌面、跳棋和台球物理。106B 参数的 MoE 模型,一次预训练就够了。
7月25日
13:11
13:11量子位@henry
Vivix推出首个实时互动模型,采用统一流式架构。单卡视频生成速度突破10000 video tokens/s。该模型打通实时多模态生成全链路,支持视频、图像、音频等模态的实时交互。相比传统非实时方案,延迟降低至毫秒级。
推荐理由:Vivix这个新模型单卡就能每秒生成上万视频token,做实时互动视频、多模态聊天特别带劲,比之前那些慢吞吞的方案强多了。
10:19
7月24日
17:45
17:45官方账号阿里云 Alibaba Cloud@alibaba_cloud
阿里云发布Token Plan,将文本、图像、视频和音频生成服务整合到一个信用池中,提供统一访问Qwen及第三方领先模型的能力。该计划起价每月4美元,适合小团队简化AI支出。支持Hugging Face等平台的模型接入。

推荐理由:小团队不用买一堆AI工具,阿里云一个Token Plan搞定文本图片视频,每月4美元起,还接入了Qwen和第三方模型。
16:54
16:12
16:12官方一手Pandaily@contact@pandaily.com (Pandaily)
NueroDance在北京活动上发布了ND1000和ND8系列EEG脑电设备,同时推出NeuroAI跨模态数据平台。该平台整合多场景神经数据,定位为超越文本和图像的下一代AI基础设施。NueroDance希望借助神经数据推动AI进入新维度。

推荐理由:NueroDance搞了个脑电硬件加数据平台,想用神经信号训练AI,跟现在纯文本图像的做法不一样。
15:26
15:26官方账号阿里云 Alibaba Cloud@alibaba_cloud
精选
在WAIC 2026上,阿里云宣布其数据库产品线(包括PolarDB、AnalyticDB、Lindorm等)向Agentic Database演进。新架构基于LakeBase、多模态记忆和全链路可观测性,旨在打造面向智能体时代的下一代数据平台。该平台将支撑大规模AI应用,实现从服务人到服务智能体的转变。

推荐理由:阿里云把数据库升级成专门给智能体用的Agentic Database,用多模态记忆和全链路监控,让AI跑得更稳更高效。
13:08
12:10
12:10官方账号arXiv cs.AI@Xiao Yu, Baolin Peng, Ruize Xu, Hao Zou, Qianhui Wu, Hao Cheng, Wenlin Yao, Nikhil Singh, Zhou Yu, Jianfeng Gao
OpenForgeRL 是一个开源框架,用于端到端训练基于推理 harness(如 Claude Code、Codex)的智能体。它通过轻量级代理记录模型调用作为训练数据,并使用 Kubernetes 编排器在远程容器中执行 rollout。在 ClawEval 上达到 31.7 pass^3 和 55.9 pass@3,在 QwenClawBench 上达到 33.7。GUI 基准测试中,OSWorld-Verified 得分 37.7,Online-Mind2Web 得分 63.0,WebVoyager 得分 72.3。这些结果超越同规模开源基线,在 GUI 场景中甚至匹配或超越数倍大的模型。
推荐理由:想用强化学习训练自己的 Claude Code 智能体?OpenForgeRL 让你在真实 harness 和环境中端到端训练,ClawEval 和 GUI 基准上表现不错,而且开源可用。
11:52
11:52官方账号arXiv cs.LG@Yingchao Huang, Xin Wang, Yuhan Su, Shanshan Yao
研究提出基于开源LLM的多模态认知障碍检测框架,融合语音音频和转录文本。在ADReSS20和ADReSSo21基准上评估,分类准确率达92.4%。该框架优于单模态基线,并展现出跨数据集泛化能力。无需访问原始敏感数据,保护患者隐私。
推荐理由:这篇论文用开源LLM整合语音和文本,在ADReSS20上准确率92.4%,比只用单一模态强多了,且跨数据库也能用。
00:45
00:45berryxia@berryxia
开发者将Kimi的MoonViT视觉编码器挂载到GLM 5.2文本模型上,形成可用的视觉版本。该项目开源了NVFP4量化权重,展示了插件式多模态组装的有效性。MoonViT编码器可独立复用,GLM 5.2快速获得看图能力,无需从头联合训练。
推荐理由:有人把Kimi的视觉编码器接到GLM 5.2上,开源了量化权重,让GLM 5.2能看图片了。这种插件式玩法很实用。
7月23日
23:57
23:57Justine Moore@venturetwins
81°
Black Forest Labs 推出 FLUX 3,一个统一多模态模型,支持图像、视频、音频和动作预测。其视频生成能力突出,单次提示即可生成最长20秒的多镜头视频,细节逼真。目前 FLUX 3 Video 已开放早期访问。该模型采用统一架构训练,可扩展至机器人动作预测。
事件专题

推荐理由:Black Forest Labs 的 FLUX 3 能用一个提示生成20秒多镜头真实视频,还可以做图像、音频和机器人预测,很值得试试。
23:00
23:00IT之家博客/媒体
华为小艺App获11.6.6.300版本升级,小艺Claw接入Kimi K3旗舰模型。Kimi K3拥有2.8万亿参数、100万Tokens上下文,基于混合线性注意力机制构建。小艺深度解题新增图文并茂讲解,翻译支持同声传译实时摘要。小艺Claw获信通院首个终端厂商智能体安全认证。
事件专题

推荐理由:华为把小艺Claw接入了Kimi K3,参数2.8万亿,能处理百万字上下文,视觉理解也强,还能深度解题和同传摘要,体验升级了。
20:22
20:22官方一手歸藏(guizang.ai)@op7418
黑森林工作室在预告中透露了新一代模型 FLUX 3。该模型支持图像、视频、音频和动作生成,是一个全模态生成模型。单条视频支持一次生成20秒。根据过往规律,该模型可能开源。
事件专题

推荐理由:黑森林工作室的 FLUX 3 预告来了,全模态还能一次生成20秒视频,可能开源,老用户该关注了。
11:38
11:38官方账号arXiv cs.AI@Xuchen Zhu, Yajuan Wei, Shuang Hao, Jiwei Jiang, Guanxiang Mao, Fang Ren
针对 RGB-D 语义分割模型在缺失 RGB 或深度模态时性能骤降的问题,研究者提出 Condition Dropout (ConD) 方法。ConD 在预训练模型基础上增加第二阶段训练,随机模拟完整、缺 RGB 或缺深度输入,冻结原编码器并训练带有零初始化特征注入的副本。在 NYU-Depth V2 和 SUN RGB-D 数据集上,ConD 在缺失模态下显著提升鲁棒性,且完整模态下略有增益。代码将在论文接收后公开。
推荐理由:做语义分割的可以看看 ConD,训练完一个模型就能同时应付缺 RGB 或缺深度的情况,还能保持全模态精度。简单有效,代码也快开源了。