14:03IT之家(博客/媒体)76°Ideogram 发布 4.0 开放权重文生图模型,9.3B 参数,采用单流 DiT 架构,文本与图像 tokens 共享注意力序列。该模型在文字绘制上表现突出,能准确呈现长文本,适合海报、商品图等场景。通过边界框和结构化 JSON 训练,用户可精确控制版式和元素位置。在 DesignArena 人类评价榜单中排名全球第 4,超越 Nano Banana Pro,成为最强开源生图模型。AI模型Ideogram 4.0开源/仓库文生图6 个信源在谈事件专题推荐理由:做设计、营销或内容创作的团队终于有了开源可部署的高质量生图模型——Ideogram 4.0 的文字绘制和布局控制能力直接对标商用产品,建议下载权重试试。原文稍后读已读值得跟进有用关注 Ideogram 4.0
04:27官方账号Decoder@Matthias Bastian78°Google DeepMind 发布了 Gemma 4 12B 开源模型,原生支持文本、图像和音频处理,仅需 16GB 内存即可在笔记本上运行。该模型在基准测试中几乎与两倍大小的 26B 模型持平,并采用 Apache 2.0 许可证,允许商业使用。这标志着多模态 AI 在消费级硬件上的重大突破,降低了开发者和企业的使用门槛。AI模型多模态开源/仓库Gemma 410 个信源在谈事件专题推荐理由:多模态模型终于能跑在普通笔记本上了,做本地 AI 应用或边缘计算的开发者可以直接下载试试,性能还接近两倍大的模型。原文稍后读已读值得跟进有用关注 多模态
03:00官方账号Decoder@Matthias Bastian78°Ideogram 发布了其文本到图像模型 4.0 版本,作为开源权重模型,支持原生 2K 分辨率、边界框控制和改进的文本渲染。在 DesignArena 排行榜上,它在所有开源模型中排名第一,仅落后于 OpenAI 和 Google 的闭源系统。商业使用需要付费许可。AI模型Ideogram文本到图像开源模型10 个信源在谈事件专题推荐理由:对于需要高质量图像生成且注重文本准确性的创作者和开发者,Ideogram 4.0 的开源权重版本提供了顶级性能,值得尝试。原文稍后读已读值得跟进有用关注 Ideogram
02:51官方一手marktechpost@Asif Razzaq88°Google DeepMind 发布了 Gemma 4 12B,一款无编码器的多模态模型,直接将视觉和音频输入送入 LLM 主干,无需传统视觉或音频编码器。该模型原生支持音频理解,可在 16GB 内存的笔记本电脑上本地运行,并采用 Apache 2.0 开源许可。这降低了多模态 AI 的硬件门槛,让开发者能在消费级设备上部署视觉和音频处理能力。Gemma 4 12B 的发布标志着多模态模型向轻量化和本地化迈出重要一步。AI模型多模态模型开源/仓库Gemma 4 12B2 个信源在谈事件专题推荐理由:多模态模型终于能跑在普通笔记本上了,做本地 AI 应用或边缘计算的开发者可以直接下载试用,16GB 内存就能跑视觉+音频推理,开源许可也友好。原文稍后读已读值得跟进有用关注 多模态模型
16:41官方一手marktechpost@Asif Razzaq83°NVIDIA 发布了 Cosmos 3,这是一款开源的“全模态世界模型”,采用双塔混合 Transformer 架构,将自回归 VLM 推理器与扩散生成器结合。该模型能够统一物理推理、世界生成和动作生成,为物理 AI 提供基础能力。Cosmos 3 旨在让机器人、自动驾驶等系统更好地理解物理世界并生成合理动作。其开源特性有望加速物理 AI 领域的研究与应用开发。AI模型NVIDIACosmos 3物理 AI10 个信源在谈事件专题推荐理由:NVIDIA 把物理推理和世界生成塞进一个开源模型,做机器人或自动驾驶的团队可以直接拿来用,省去从头训练物理世界模型的成本。原文稍后读已读值得跟进有用关注 NVIDIA
14:48官方一手Pandaily@contact@pandaily.com (Pandaily)精选中国开源世界模型 Boundless 在全球排行榜上超越 Google、NVIDIA 等巨头的产品,成为第一名。世界模型是能理解和模拟物理现实的 AI 系统,对机器人、自动驾驶等领域至关重要。Boundless 的开源特性降低了研究门槛,让更多团队能参与开发。这一突破显示中国在 AI 基础模型领域的竞争力正在增强。AI模型世界模型开源/仓库物理模拟10 个信源在谈事件专题推荐理由:世界模型是 AI 的下一个前沿,做机器人或自动驾驶的团队可以直接用 Boundless 开源代码加速研发,值得关注。原文稍后读已读值得跟进有用关注 世界模型
12:21IT之家(博客/媒体)精选智元机器人开源了行业首个聚焦物理交互的具身数据集 AGIBOT WORLD 2026 第二期“多样交互”。该数据集系统记录了机器人与真实物理世界之间的复杂、高密度、非理想交互过程,旨在补齐当前世界模型训练中缺失的真实物理交互数据。它将具身智能的数据范式从“学习成功动作”推进到“理解完整的物理分布”,对世界模型、神经仿真器、物理感知等研究至关重要。目前数据集已在 Hugging Face 开放下载。AI模型具身智能开源/仓库数据集推荐理由:做具身智能或世界模型研究的团队终于有了真实物理交互数据,不再是模拟器里的完美动作——补齐了训练的关键短板,搞机器人的建议直接去 Hugging Face 下载。原文稍后读已读值得跟进有用关注 具身智能
06:32官方账号Simon Willison’s Weblog(博客/媒体)76°微软今日发布两款新文本 LLM:MAI-Thinking-1(35B 参数,推理模型,面向早期合作伙伴)和 MAI-Code-1-Flash(5B 参数,专为 GitHub Copilot 和 VS Code 设计,已向个人用户推出)。MAI-Thinking-1 在盲测中优于 Sonnet 4.6,且参数规模较小,运行成本更低。两款模型均使用清洁、商业授权数据从头训练,未蒸馏第三方模型,也未使用未授权的网络数据。这标志着微软在低成本、合规数据训练的高效模型上迈出重要一步。AI模型微软MAI-Thinking-1MAI-Code-1-Flash推荐理由:微软用 35B 参数模型挑战 Sonnet 4.6,证明小模型也能出奇迹——做推理应用或 Copilot 开发的团队值得关注,尤其是对数据合规有要求的项目。原文稍后读已读值得跟进有用关注 微软
02:26IT之家(博客/媒体)83°微软在 Build 2026 大会上发布自研 AI 模型系列,包括首款高级推理模型 MAI-Thinking-1。该模型为中等规模,在软件工程基准测试中达到业界领先水平,并承诺完全自研、未使用第三方蒸馏数据。同时发布的还有图像生成模型 MAI-Image 2.5、语音转写模型 MAI-Transcribe-1.5(速度达竞品五倍)、语音合成模型 MAI-Voice-2 及编程辅助模型 MAI-Code-1。MAI-Code-1 已集成到 GitHub Copilot 和 VS Code 中。这标志着微软在推理、图像、语音和编程等 AI 领域全面布局自研模型。AI模型推理模型微软MAI-Thinking-1推荐理由:微软终于拿出了自己的推理模型,而且强调纯自研、不蒸馏,这对关注模型自主可控的开发者是个信号。做软件工程或编程的团队可以关注 MAI-Code-1 在 Copilot 中的实际表现,值得一试。原文稍后读已读值得跟进有用关注 推理模型
22:33官方一手Hugging Face: Blog(博客/媒体)Holo3.1 是一个专注于本地化计算机操作的 AI 智能体模型,能够在用户设备上快速执行任务,如文件管理、应用操作等。它强调低延迟和隐私保护,无需依赖云端服务。该模型在多项基准测试中表现出色,尤其适合需要即时响应的场景。Holo3.1 的发布为本地 AI 智能体领域提供了新的选择,降低了使用门槛。AI模型智能体本地化隐私保护推荐理由:对于注重隐私和响应速度的开发者,Holo3.1 提供了本地化计算机操作的实用方案,可以直接在设备上运行,建议尝试集成到自动化工作流中。原文稍后读已读值得跟进有用关注 智能体
17:15官方一手marktechpost@Michal Sutter83°阿里Qwen团队在百炼平台推出Qwen3.7-Plus,这是一个多模态智能体模型。它不仅能理解图像和视频,还新增了自主编程、工具调用和深度推理能力。该模型支持视觉理解、复杂推理和自动化迭代,可应用于更广泛的AI任务场景。这标志着阿里在构建全能型AI智能体方面迈出重要一步。AI模型Qwen3.7-Plus多模态智能体3 个信源在谈事件专题推荐理由:Qwen3.7-Plus把视觉、推理和工具调用整合到一个模型里,做多模态应用的开发者可以直接在百炼平台体验,省去拼接多个模型的麻烦。原文稍后读已读值得跟进有用关注 Qwen3.7-Plus
16:05官方一手marktechpost@Asif Razzaq精选JetBrains 发布了 Mellum2,一个 12B 参数的混合专家(MoE)模型,基于 Apache 2.0 开源协议。该模型在 10.6 万亿 token 上训练,专为多模型 AI 流水线中的快速专用任务优化,如代码补全、重构建议等。Mellum2 旨在平衡性能与效率,适合集成到开发工具中,提升开发者体验。其 MoE 架构使其在保持较小激活参数的同时,实现高精度输出。AI模型JetBrainsMellum2MoE推荐理由:JetBrains 把 MoE 模型塞进开发者工具链,做 IDE 插件或代码分析工具的团队可以直接用 Mellum2 替换通用模型,提升响应速度且不牺牲质量。原文稍后读已读值得跟进有用关注 JetBrains
13:44IT之家(博客/媒体)精选72°JetBrains 于 6 月 1 日开源了 Mellum2 模型,这是其面向软件工程系统的新一代机器学习模型。相比原版 Mellum,Mellum2 从代码补全模型升级为完整的编码助手,上下文窗口从 8192 Token 扩展到 131072 Token。该模型总参数为 12B,采用稀疏混合专家框架,激活时参数量为 2.5B,在标准硬件上仍能保持较快计算。Mellum2 支持代码生成与编辑、外部工具调用、多步骤智能体工作流和长对话维持,定位在 AI 工作负载路由、低延迟 RAG 管线、复杂工作流中的子智能体以及私有本地 AI 部署。JetBrains 已开源基础版、指令版和思考版,开发者可在 Apache 2.0 许可证下使用。AI模型JetBrainsMellum2开源/仓库推荐理由:JetBrains 把自家 IDE 的 AI 能力下放给社区了——做 JetBrains 插件开发或自建 AI 编程管线的团队,可以直接用 Mellum2 跑本地智能体工作流,省去自己训练和调优的麻烦。原文稍后读已读值得跟进有用关注 JetBrains
09:44官方一手Pandaily@contact@pandaily.com (Pandaily)精选Deep Principle 发布了 MPA(Materials Property Axiom),一个用于材料科学的 AI 基础模型。该模型借鉴了大语言模型的训练技术,在 40 项真实工业任务上取得了最先进的结果。MPA 能够预测材料属性,加速新材料发现和设计过程,有望在电池、半导体、合金等领域产生重大影响。这标志着 AI 在材料科学领域的应用迈出了重要一步。AI模型材料科学基础模型MPA推荐理由:材料科学家和工业研发团队终于有了一个强大的 AI 工具,MPA 在 40 项工业任务上达到 SOTA,能大幅缩短材料筛选周期,做新材料开发的团队值得关注。原文稍后读已读值得跟进有用关注 材料科学
09:44官方一手Pandaily@contact@pandaily.com (Pandaily)精选阿里巴巴通义千问团队正式推出Qwen-VLA,这是其首个面向具身智能的视觉-语言-动作模型,标志着阿里进入物理世界AI竞赛。该模型整合了视觉理解、语言推理和动作执行能力,旨在让机器人或智能体在真实环境中完成复杂任务。Qwen-VLA的发布意味着阿里在AI领域的布局从纯数字世界扩展到物理交互,与特斯拉、英伟达等公司形成竞争。此举可能加速具身智能在工业、服务等场景的落地。AI模型具身智能视觉-语言-动作模型阿里千问1 个信源在谈事件专题推荐理由:阿里千问首次将大模型能力延伸到物理世界,做机器人或具身智能的开发者值得关注——Qwen-VLA可能降低机器人编程门槛,让AI直接驱动动作执行。原文稍后读已读值得跟进有用关注 具身智能
06:41IT之家(博客/媒体)精选阿里千问大模型推出 Qwen3.7-Plus,定位为多模态交互混合智能体,在保留文本、编码、工具使用等能力基础上,强化了视觉理解、视觉推理和跨模态任务处理。该模型支持图像、视频、屏幕、网页和文本输入,可在 GUI、CLI 和工具环境中完成复杂软件与办公流程。在 Vision Arena 评测中,阿里凭借该模型进入全球前 5、中国第 1,多模态测试在 BabyVision、MathVision 等基准上提升明显。模型已通过阿里云百炼和 Qwen Studio 提供服务。AI模型Qwen3.7-Plus多模态智能体4 个信源在谈事件专题推荐理由:Qwen3.7-Plus 把视觉与语言统一到智能体基座,做多模态应用或办公自动化的团队可以直接在百炼上试,能省掉不少模型拼接的麻烦。原文稍后读已读值得跟进有用关注 Qwen3.7-Plus
04:47官方一手marktechpost@Asif Razzaq78°MiniMax 正式发布新一代大模型 MiniMax M3,采用自研的 MiniMax Sparse Attention(MSA)架构,支持高达 100 万 token 的超长上下文窗口。该模型原生支持图像、视频理解以及计算机使用(computer use)能力,并具备智能体编程(agentic coding)功能。MSA 架构通过稀疏注意力机制显著降低长序列计算成本,使得处理百万级 token 成为可能。这标志着国产大模型在长上下文和多模态融合方面迈出了重要一步,为复杂文档分析、视频理解和自动化编程等场景提供了新的基础设施。AI模型MiniMaxM3MSA架构推荐理由:MiniMax M3 的 1M 上下文和原生多模态能力直接解决了长文档分析和视频理解的痛点,做 RAG 应用或自动化编程的团队值得关注其 agentic coding 特性。原文稍后读已读值得跟进有用关注 MiniMax
01:41官方账号Decoder@Matthias Bastian76°图灵奖得主Richard Sutton指出,传统生成式AI的核心缺陷在于无法评估自身结果,因此无法实现真正的科学发现。他认为,没有内置评估循环,AI产生的创新只是昙花一现,无法积累。相比之下,AlphaGo和AlphaProof等系统通过内置评估机制展现了真正的创造力。Sutton的观点挑战了当前大语言模型在科学研究中的主导地位,强调评估能力是AI实现科学突破的关键。AI模型生成式AI科学发现评估循环推荐理由:Sutton戳中了生成式AI的致命短板——没有自我评估能力,做科研的团队和AI开发者值得深思:你的模型真的能推动科学发现吗?原文稍后读已读值得跟进有用关注 生成式AI
00:33官方一手Hugging Face: Blog(博客/媒体)精选72°JetBrains 发布了 Mellum2,一个 12B 参数的混合专家(MoE)模型,专为代码生成和软件工程任务优化。该模型在 HumanEval 和 SWE-bench 等基准测试中表现优异,超越了同等规模的模型。Mellum2 基于 JetBrains 的代码数据训练,旨在为开发者提供更高效、更准确的代码补全和生成能力。该模型现已开源,可在 Hugging Face 上获取。AI模型JetBrainsMellum2MoE推荐理由:JetBrains 的 Mellum2 为 IDE 内代码生成带来了更精准的 MoE 方案,用 JetBrains 全家桶的开发者可以直接在 Hugging Face 上体验,看看它能否提升你的编码效率。原文稍后读已读值得跟进有用关注 JetBrains
21:50官方账号Decoder@Jonathan Kemper78°中国AI公司MiniMax发布了新模型M3,号称是首个结合顶级编码性能、百万token上下文窗口和原生多模态能力的开源权重模型。该模型在多项基准测试中表现优异,尤其在长上下文任务和代码生成方面,直接挑战GPT-4、Claude等闭源模型。M3的开源特性使得开发者可以自由部署和微调,降低了使用门槛。这一发布标志着开源模型在关键能力上正快速追赶闭源方案。AI模型MiniMaxM3开源模型推荐理由:百万token上下文+开源权重,做长文档处理或代码分析的团队可以直接部署,不用再被闭源API的token计费卡脖子。原文稍后读已读值得跟进有用关注 MiniMax
21:50官方账号Decoder@Maximilian Schreiner基准测试平台 Artificial Analysis 显示,Nvidia 的 Nemotron 3 Ultra 是目前美国最强大的开源 AI 模型,在多项指标上超越此前领先的 Llama 3 等模型。然而,该模型在整体性能上仍落后于中国开源模型如 DeepSeek 和 Qwen,表明中国在开源 AI 领域的领先地位依然稳固。这一进展凸显了美国在开源模型竞争中的追赶态势,但中国模型在推理、多模态等关键能力上仍保持优势。AI模型NvidiaNemotron 3 Ultra开源模型10 个信源在谈事件专题推荐理由:Nvidia 终于拿出了美国最强的开源模型,但中国开源模型依然领先,做模型选型和对比的开发者值得关注这一格局变化。原文稍后读已读值得跟进有用关注 Nvidia
15:16官方一手pandaily@contact@pandaily.com (Pandaily)精选83°MiniMax 发布了其旗舰模型 M3,声称这是国内首个将前沿编码、智能体能力、100 万 token 上下文窗口和原生多模态处理整合在单一架构中的 AI 模型。M3 模型在多项基准测试中表现出色,尤其在长文本理解和复杂任务执行方面。该模型支持同时处理文本、图像、音频等多种输入,并具备强大的代码生成和工具调用能力。MiniMax 表示 M3 旨在为开发者和企业提供更高效、更全面的 AI 解决方案。AI模型MiniMaxM3多模态推荐理由:MiniMax M3 将 1M 上下文、多模态和智能体能力打包进一个模型,做长文本处理或多模态应用的开发者可以直接用它替代多个模型组合,省心又高效。原文稍后读已读值得跟进有用关注 MiniMax
14:33官方一手Hugging Face: Blog(博客/媒体)83°NVIDIA 发布了 Cosmos 3,这是首个开源的物理 AI 全能模型,能够同时进行推理和行动。该模型基于多模态输入(如视觉、语言)理解物理世界,并生成可执行的动作序列。Cosmos 3 在机器人、自动驾驶等需要物理交互的领域具有重大意义,因为它将感知、推理和行动整合在一个模型中。NVIDIA 在 Hugging Face 上开源了该模型,开发者可以直接使用或微调。AI模型物理 AI开源/仓库NVIDIA9 个信源在谈事件专题推荐理由:做机器人或自动驾驶的开发者终于有了一个开源的物理世界理解模型,能直接推理并生成动作,省去多模型拼接的麻烦,值得立即上手试试。原文稍后读已读值得跟进有用关注 物理 AI
13:59IT之家(博客/媒体)88°英伟达发布全球首款全开源全模态物理AI大模型Cosmos 3,基于混合Transformer架构,融合视觉推理、世界生成与动作预测能力。该模型可原生理解并生成文本、图像、视频、环境音效及动作内容,物理仿真精度业界领先,能将训练与评估周期从数月缩短至数日。英伟达同时发起Cosmos联盟,联合多家机构推动世界模型技术发展。Cosmos 3提供Super、Nano、Edge三个版本,分别面向机器人/自动驾驶训练、快速推理和边缘端实时推理。AI模型英伟达Cosmos 3物理AI推荐理由:英伟达把物理AI的门槛打下来了——全开源、全模态、训练周期从月缩到天,做机器人、自动驾驶或视觉AI的团队可以直接拿来用,省掉从头造轮子的成本。原文稍后读已读值得跟进有用关注 英伟达
13:05IT之家(博客/媒体)精选76°英伟达发布 Alpamayo 2 Super,一款 320 亿参数的视觉-语言-动作(VLA)开源模型,专为 L4 自动驾驶研发设计。该模型具备类人感知、推理与行动能力,支持全车环视感知和元动作输出,可免去企业从零搭建核心基础设施。英伟达同步推出 AlpaGym 闭环强化学习平台、OmniDreams 世界模型等工具,打通从数据采集到车载部署的全流程。模型定位为教师模型,可通过知识蒸馏部署在 DRIVE AGX Thor 芯片上,已获比亚迪、吉利等车企采用。推理代码预计夏季开源。AI模型英伟达Alpamayo 2 Super自动驾驶推荐理由:英伟达把自动驾驶模型参数翻了三倍,还开源了全套工具链,做 L4 研发的团队可以直接省掉从零搭建的环节,建议关注夏季开源代码。原文稍后读已读值得跟进有用关注 英伟达
12:50IT之家(博客/媒体)精选78°英伟达发布 Nemotron 3 Ultra 开源模型,拥有 5500 亿参数,采用混合专家架构,专为全天候运行的自主智能体设计。该模型在推理速度上较同级别前沿模型最高提升 5 倍,使用成本降低 30%,并已适配 Hermes Agent、LangChain 等主流智能体平台。同时推出安全防护和语音识别模型,增强企业级智能体能力。CrowdStrike 和 Palantir 已将其用于网络安全和业务流程自动化。模型将于 6 月 4 日通过 Hugging Face 等平台以 NIM 微服务形式开放。AI模型英伟达Nemotron 3 Ultra开源模型5 个信源在谈事件专题推荐理由:英伟达把大模型推理速度和成本同时优化了,做智能体开发或企业自动化的团队可以直接用上,比现有开源方案更高效省钱,值得关注。原文稍后读已读值得跟进有用关注 英伟达
12:36官方一手marktechpost@Asif Razzaq精选Parallax是一种新型参数化局部线性注意力(LLA)机制,通过学习投影器替换逐查询求解器,将算术强度提升至原来的两倍。在0.6B和1.7B参数规模的语言模型上,Parallax显著降低了困惑度。该方法在保留原始Softmax注意力的同时,引入了一个学习的协方差校正分支,用于建模更丰富的上下文依赖。AI模型ParallaxLLASoftmax推荐理由:注意力效率翻倍,困惑度更低原文稍后读已读值得跟进有用关注 Parallax
10:02IT之家(博客/媒体)78°MiniMax 稀宇科技发布了旗舰模型 M3,宣称是首个同时具备前沿编码与智能体能力、百万上下文和原生多模态的国产模型。M3 在编码与智能体评测中达到行业顶尖水平,能自主拆解任务、调用工具和多步推理,API 最高支持 1M tokens 上下文窗口。在 BrowseComp 智能体评测中,M3 以 83.5 分超越 Opus 4.7。M3 是原生多模态模型,从预训练阶段就进行多模态训练,使文本和视觉语义高度对齐。MiniMax 还展示了 M3 独立复现 ICLR 论文和自主训练四个 Base 模型的能力。API 已上线,提供标准版和高速版,价格有 7 天限时五折优惠,模型即将开源。AI模型MiniMax M3国产旗舰模型百万上下文6 个信源在谈事件专题推荐理由:MiniMax M3 把编码、智能体、长上下文和多模态全塞进一个模型,做复杂自动化或长视频分析的开发者可以直接试,价格还有限时折扣。原文稍后读已读值得跟进有用关注 MiniMax M3
07:39IT之家(博客/媒体)精选英伟达N1x处理器在Geekbench 6预发布跑分中与苹果2023年发布的M3 Max芯片基本持平。N1x采用联发科设计的20核ARM架构CPU,集成RTX 5070级别显卡,基于LPDDR5X统一内存架构。该处理器是GB10系统级芯片的改版,曾用于DGX Spark迷你主机。跑分数据采集于2025年6月,量产版在系统适配后成绩可能提升。对比中M3 Max为14核CPU,N1x为20核,核心数占优下跑分持平,凸显苹果芯片设计优势。AI模型N1xM3 MaxGeekbench 6推荐理由:N1x跑分追平M3 Max原文稍后读已读值得跟进有用关注 N1x
19:45官方账号Decoder@Jonathan Kemper精选伦敦初创公司 Kaikaku.AI 推出名为 Epicure 的三个 AI 模型,首次明确区分食材搭配是基于食谱还是化学分子。模型基于 414 万条多语言食谱和 FlavorDB 风味数据库训练,不同变体给出不同推荐。纯化学模型在口味和营养价值分类上甚至优于食谱模型,尽管从未直接接触这些信息。这项研究揭示了 AI 在食品科学中的新应用方向。AI模型AI模型食材搭配食谱推荐理由:做食品推荐系统或菜谱应用的开发者,可以看看化学模型如何超越食谱模型——它可能改变你设计食材搭配逻辑的方式。原文稍后读已读值得跟进有用关注 AI模型
18:30IT之家(博客/媒体)精选开放媒体联盟(AOMedia)于5月29日发布AV2 v1.0规范,这是AV1的继任者。官方测试显示,AV2在PSNR-YUV指标下码率较AV1降低约28.63%,VMAF指标下降32.59%,画质基本保持不变。AV2增强了对AR/VR应用、分屏多节目传输和屏幕内容编码的支持。不过,参考软件AVM在主流硬件上仅约1帧/秒,距离实际商用尚需时间。AI模型AV2AV1AOMedia推荐理由:新一代编码标准,省码率近30%原文稍后读已读值得跟进有用关注 AV2
17:48IT之家(博客/媒体)精选西北工业大学、西安电子科技大学等团队提出 HG-STR(异构图时空推理)算法,解决通信中断、视野受限下的无人机蜂群自主作战难题。模拟测试中,任务成功率 96%,目标杀伤率 100%,单步决策耗时 6.6 毫秒,较传统规则算法任务完成率提升 37.14%。即使在通信半径极度受限的弱连通条件下,仍能保持 94% 的任务成功率。该算法通过为每架无人机配备记忆模块和分层决策机制,实现了从小场景训练到大场景即时部署。AI模型HG-STR无人机蜂群多智能体推荐理由:中国团队发布无人机蜂群算法HG-STR,通信中断下仍能100%消灭目标原文稍后读已读值得跟进有用关注 HG-STR
10:19官方一手marktechpost@Michal Sutter精选72°Trajectory 与 UC Berkeley Sky Lab 和 Anyscale 合作,构建了一个用于持续学习的并发多 LoRA 训练栈。该方案将每个强化学习实验映射到始终热运行的引擎上的专用 LoRA 适配器,相比单租户基线实现了 2.81 倍的端到端实验吞吐量提升,且无奖励回归。代码已在 NovaSky-AI/SkyRL 开源。这一进展解决了持续学习中多实验并行效率低下的问题,对强化学习研究和工程团队有直接价值。AI模型LoRA持续学习强化学习推荐理由:做强化学习持续训练的团队终于有了高效的并行方案——2.81 倍吞吐量提升且不损失奖励,直接开源可用,建议试试。原文稍后读已读值得跟进有用关注 LoRA
23:18IT之家(博客/媒体)精选72°智元机器人自研的世界模型 Genie Envisioner-Sim 2.0(GE 2.0)在具身领域热门榜单 WorldArena Track1 中登顶,该赛道评测世界模型的感知与动作响应能力。GE 2.0 仅用 20 亿参数,就超越了英伟达、微软等团队的超大参数模型,验证了轻量化模型在人形机器人应用中的适配性。该模型首次全面覆盖长时序生成、多视角生成、本体状态生成、近实时推理及奖励判别等核心环节,在长时序推理中能稳定生成 40-50 秒高质量视频,且与真实世界保持强相关性。GE 2.0 还具备奖励模型机制,可自动筛选高质量数据回流给策略模型,助力多项任务性能提升。AI模型世界模型具身智能智元推荐理由:智元用 2B 参数模型在具身智能世界模型赛道击败英伟达等巨头,做机器人或具身智能的开发者值得关注——轻量化方案可能改写行业路线。原文稍后读已读值得跟进有用关注 世界模型
10:33IT之家(博客/媒体)精选72°英伟达联合香港理工大学、南京大学发布 LocateAnything 模型,专为机器人和 AI Agent 设计,实现高速、高精度对象检测。该模型通过并行框解码在单步内预测边界框,提供 Fast、Slow 和 Hybrid 三种模式,兼顾速度和精度。在单张 H100 GPU 上,Hybrid 模式每秒处理 12.7 个框,远超 Qwen3-VL 等模型。训练数据涵盖 12M 图像和 138M 查询,覆盖多种定位场景。该模型在 LVIS 高精度任务和 ScreenSpot-Pro 等基准上表现优异。AI模型英伟达LocateAnything对象检测推荐理由:机器人感知和 GUI 自动化开发者终于有了一个兼顾速度和精度的检测方案——LocateAnything 的并行解码设计让实时交互成为可能,做具身智能或屏幕操作 Agent 的团队值得直接试。原文稍后读已读值得跟进有用关注 英伟达
05:27官方一手marktechpost@Asif RazzaqStepFun 发布了 Step 3.7 Flash,一个 198B 参数的 MoE(混合专家)视觉语言模型,原生支持视觉理解、256k 上下文窗口和 Advisor Mode(顾问模式)。该模型针对编程智能体和搜索工作流进行了优化,能够在复杂任务中提供高效推理和代码生成能力。Step 3.7 Flash 的发布标志着多模态大模型在专业领域应用的重要进展,尤其适合需要长上下文理解和视觉-语言联合推理的场景。AI模型Step 3.7 FlashMoE视觉语言模型推荐理由:做 AI 编程智能体或搜索应用的团队可以直接用上 256k 上下文和视觉能力,Step 3.7 Flash 的 Advisor Mode 能显著提升复杂任务处理效率,值得关注。原文稍后读已读值得跟进有用关注 Step 3.7 Flash
17:17IT之家(博客/媒体)76°小米大模型应用团队开源了 ControlFoley,一个统一的可控视频音效生成框架,解决了视频配音中“按意图控制声音”的难题。该模型支持三类任务:文本引导视频配音、文本控制视频配音(当文本与画面冲突时优先遵循文本)、以及参考音频控制视频配音(保持音色风格同时同步动作)。ControlFoley 采用时空音视频编码器 CAV-MAE-ST 增强音画同步理解,并通过时间-音色解耦策略避免参考音频干扰节奏。在多个基准测试上,ControlFoley 达到开源 SOTA,甚至在某些指标上超越商业闭源系统 Kling-Foley。代码、模型权重、在线 Demo 均已开放。AI模型小米ControlFoley视频音效生成推荐理由:做视频创作或音效生成的开发者终于有了可控的配音工具——ControlFoley 让声音按文本或参考音频来,而不是被画面牵着走。建议直接试在线 Demo,看看它如何解决“画面是A但想要B声音”的痛点。原文稍后读已读值得跟进有用关注 小米
16:39官方一手pandaily@contact@pandaily.com (Pandaily)精选X-Square Robot 推出了 WALL-WM,这是全球首个事件级预测的具身 AI 世界模型。与传统逐帧预测不同,WALL-WM 转向语义事件理解,让机器人能够理解任务目标而非记忆像素序列。该模型预计于 2026 年 5 月正式发布。这一突破意味着机器人可以更高效地规划动作,减少对大量训练数据的依赖,推动具身智能从感知走向认知。AI模型具身智能世界模型事件预测推荐理由:做机器人或具身智能的团队终于有了能理解任务目标的模型——WALL-WM 从像素预测升级到事件理解,直接降低训练成本,做自主导航或操作任务的开发者值得关注。原文稍后读已读值得跟进有用关注 具身智能
15:35官方一手marktechpost@Asif Razzaq精选72°Hexo Labs 开源了 SIA,一个自改进循环系统,采用 MIT 许可证。SIA 通过反馈智能体读取每次运行的轨迹,然后重写脚手架或触发 gpt-oss-120b 的 LoRA 权重更新。结合这两种杠杆,在 LawBench、TriMul GPU 内核和 scRNA-seq 去噪任务上,SIA 的表现优于仅更新脚手架的方法。这为 AI 智能体的持续自我优化提供了新范式,开发者可以直接使用或修改。AI模型自改进智能体开源/仓库LoRA 权重更新1 个信源在谈事件专题推荐理由:SIA 解决了智能体无法自主改进代码和模型权重的问题,做 AI 智能体或自动化系统的开发者可以直接用这个开源框架来提升任务性能,值得一试。原文稍后读已读值得跟进有用关注 自改进智能体
11:17官方一手pandaily@contact@pandaily.com (Pandaily)78°Stepfun 开源了 Step 3.7 Flash,这是一个 196B 参数的稀疏 MoE 大语言模型,专为智能体工作流优化。该模型推理速度达 400 tokens/s,并原生支持工具调用,能高效执行复杂任务。开源此举旨在推动智能体生态发展,降低开发者构建自主系统的门槛。Step 3.7 Flash 在多项基准测试中表现优异,尤其适合需要快速响应和工具集成的场景。AI模型Step 3.7 FlashMoE智能体推荐理由:做智能体开发的团队终于有了一个原生支持工具调用且速度极快的开源模型——400 tokens/s 的推理速度能显著提升任务执行效率,建议直接上手测试。原文稍后读已读值得跟进有用关注 Step 3.7 Flash