10:10官方账号arXiv cs.AI@Bo Yin, Xiaobin Hu, Chengming Xu, Ruolin Shen, Mo Yang, Jiangning Zhang, Peng-Tao Jiang, Cheng Tan, Shuicheng YANSPOT-E方法针对视觉语言模型在处理证据密集型任务时因小区域视觉证据被忽略导致的读取失败问题。该方法利用答案跨度预测熵作为模型内部反馈,通过低熵锚点和熵整形目标消除歧义,避免模型陷入捷径塌缩。SPOT-E基于GRPO进行每实例轻量级调优,生成问题条件化的聚光灯。在多个VLM族和基准测试中,SPOT-E一致提升了性能并增强了视觉损坏鲁棒性。代码已开源。论文SPOT-EVLMGRPO推荐理由:SPOT-E这个新方法挺有意思,它不重训模型,只在推理时搞了个视觉聚光灯和熵整形,就让VLM在那些需要细看局部证据的任务上表现好多了。尤其用GRPO调优,效果提升还挺稳定。原文稍后读已读值得跟进有用关注 SPOT-E
06:40Stanford AI Lab@StanfordAILab精选斯坦福AI实验室发布M*运行时,用于统一服务多模态模型。相比专业系统,M*在omni TTS任务上提速2.7倍,在world-model rollouts任务上提速12.5倍。它匹配或超越所有专门系统的性能。AI产品M*斯坦福多模态推荐理由:斯坦福新发的M*运行时,一个系统就能搞定各种多模态模型,速度比专业方案快2到12倍,值得做部署的看看。原文稍后读已读值得跟进有用关注 M*
15:52IT之家(博客/媒体)DeepSeek 识图模式已在网页和 App 端正式上线,App 端标注“图片理解功能内测中”,网页端无此提示。该模式与快速模式、专家模式并列,支持用户上传图片让 DeepSeek 解读。其能力不仅是文字提取,还能理解图像内容。背后的多模态模型技术已于今年 4 月公开,核心框架名为“Thinking with Visual Primitives”。AI产品DeepSeek识图模式多模态推荐理由:DeepSeek 现在能识图了,App 和网页都能用,不只是 OCR,还能理解画面,背后有专门的多模态技术。原文稍后读已读值得跟进有用关注 DeepSeek
12:35IT之家(博客/媒体)73°阿里与人大联合开源 LOGOS,这是一个基于统一“科学语法”的多领域科学生成基础模型。LOGOS-1B 仅用 1B 参数量,在多项科学任务上超越参数为 8×7B 的微软 NatureLM。模型预训练语料涵盖蛋白质(28.9B tokens)、抗体(3.0B tokens)、小分子(2.1B tokens)等 7 类模态共 44.87B tokens。它通过共享词表将异构对象编码为离散 token,无需 3D 坐标即可理解 3D 空间互作规律。LOGOS 已开源模型权重、推理代码与技术报告。AI模型LOGOSNatureLM开源模型推荐理由:阿里开源的 LOGOS 模型,用 1/56 参数就碾压了微软 NatureLM,还统一了蛋白质、小分子等科学对象的语言,搞科研的可以看看源码和论文,开箱即用。原文稍后读已读值得跟进有用关注 LOGOS
10:57官方账号arXiv cs.LG@Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin, Nikita Kurlaev, Daria Pugacheva, Albina Burlova, Mikhail Kolosov, Denis Shepelev, Andrey Kuznetsov, Elena Tutubalina, Aleksandr I. Panov, Alexey K. Kovalev, Vlad Shakhuro论文提出 Act2Answer 协议,通过让智能体在桌面场景中执行物体放置动作来选择答案,从而在动作层面评估 7 个 VLA 模型和 9 个 VLM 基线在常识与知识任务上的表现。研究发现,VLA 在简单概念上表现扎实,但在丰富语义类别上相比源 VLM 出现更大差距。实验还表明,VQA 联合训练有助于提升知识保留,而答案相关信息在 VLA 中层达到峰值,上层则衰减。论文VLAVLMAct2Answer推荐理由:想知道微调后的机器人模型到底还记不记得常识?这篇论文用动作答题的方式测了7个VLA,发现简单概念还行,复杂知识掉得厉害。原文稍后读已读值得跟进有用关注 VLA
10:38官方账号arXiv cs.LG@Hugo Miccinilli, Theo Di PiazzaChronoSurv是一个基于有向图的框架,用于头颈癌患者的多模态生存预测。它将患者诊疗过程建模为按诊断步骤对齐的临床轨迹,并通过分层拓扑整合细粒度、粗粒度和全局表示。在两个公开数据集上,ChronoSurv实现了优于现有方法的判别性能,且校准误差达到统计显著水平。消融实验验证了各组件对整体性能的贡献。论文ChronoSurv生存分析多模态推荐理由:这篇论文把临床流程做成图结构来预测生存时间,比传统方法更准,适合做医疗AI的朋友看看。原文稍后读已读值得跟进有用关注 ChronoSurv
10:34官方账号arXiv cs.LG@Sihan Wang, Xiyao Liu, Lianqing Liu, Zhi HanViGOS是一种针对多模态大语言模型(MLLM)的后训练框架,采用解耦感知与推理的自蒸馏方法(OPSD)。学生模型先生成视觉描述,再基于此进行推理,避免直接利用文本目标产生捷径。实验在通用视觉-语言、专家推理、视觉数学、空间定位和视觉-语言先验五类基准上验证,ViGOS在易出现捷径的场景中显著提升了图像依赖行为。论文ViGOSMLLMOPSD推荐理由:这篇论文提出了ViGOS,专门解决多模态模型自蒸馏时只看文本不看图的毛病,在多个视觉语言基准上有效果。原文稍后读已读值得跟进有用关注 ViGOS
09:41官方账号arXiv cs.AI@Jinhao Song, Shan Liang, Yiqun Yue, Zhuhuayang Zhang, Tianqi GaoThinkDeception首次将多模态大语言模型(MLLM)引入欺骗检测领域,将其从二分类任务转变为显式认知推理过程。研究团队构建了首个逐步多模态思维链(CoT)数据集,并基于此开发基础模型ThinkDeception Base。核心创新是提出Visual-Audio Consistency Group Relative Policy Optimization(VAC-GRPO),采用渐进式训练将数据分为四个难度层级。在主流基准上,ThinkDeception在检测准确性和推理质量上达到新SOTA。AI模型ThinkDeceptionMLLM多模态推荐理由:这个框架用MLLM和思维链一步步拆解欺骗线索,比黑箱模型更能解释为什么判定说谎,准确率还最高。原文稍后读已读值得跟进有用关注 ThinkDeception
10:17官方账号arXiv cs.LG@Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, Xiong-Hui Chen83°Qwen-RobotManip是基于Qwen-VL构建的视觉-语言-动作基础模型。它引入统一对齐框架,覆盖表示、运动和操作行为三个维度,使多源训练数据协调一致。通过人工到机器人的合成流水线,利用15种平台的示教数据,构建了约38,100小时的预训练语料。模型在RoboCasa365、LIBERO-Plus、EBench等OOD基准上显著优于先前最佳模型π0.5,并在AgileX ALOHA、Franka、UR、ARX等真实机器人平台上验证。AI模型Qwen-RobotManipQwen-VL机器人基础模型1 个信源在谈事件专题推荐理由:阿里Qwen团队这个机器人模型用开源数据和人类演示就能学,跨平台零样本操作,还在多个测试里碾压了π0.5,做机器人开发的别错过。原文稍后读已读值得跟进有用关注 Qwen-RobotManip
07:57IT之家(博客/媒体)彭博社马克·古尔曼爆料,苹果带摄像头的AirPods将延迟到2027年发布。延迟原因是苹果在Apple智能/Siri AI方面面临开发挑战,同时需优化用于识别周围物体的视觉AI模型。该耳机左右均配备低分辨率摄像头,外观类似AirPods Pro 3。苹果还在探索通过摄像头提供基于视觉的提醒和逐向导航功能。AI产品AirPods苹果摄像头推荐理由:苹果因为AI研发挑战,把带摄像头的AirPods推迟到2027年了,想实现视觉导航的功能还得等。原文稍后读已读值得跟进有用关注 AirPods
07:29IT之家(博客/媒体)谷歌正式推送 Android 17 系统,并同步发布 Wear OS 7。新版安卓深度集成 AI 模型,包括音乐生成模型 Lyria 3、多模态大模型 Gemini Omni 以及基于 AudioLM 的语音翻译工具。Pixel 系列设备率先获得更新,Pixel 10a 搭载实时同声传译功能。系统新增同屏录摄、气泡任务栏、折叠屏游戏模式等实用功能。Wear OS 7 续航提升 10%,并新增紧急状况检测和 Gemini 智能功能。AI产品Android 17Gemini OmniLyria 3推荐理由:谷歌刚推的Android 17,深度集成了AI,能用Lyria 3生成音乐、Gemini Omni剪视频、AudioLM实时翻译,Pixel 10a还有新功能,挺实用。原文稍后读已读值得跟进有用关注 Android 17
06:28AK@_akhaliqData Journalist Agent是一个能将结构化数据自动转化为多模态报道的智能体,输出包括图表、文本和视频。它内置事实核查机制,每一条数据均可追溯原始来源。这个智能体旨在提升数据新闻的生产效率和可信度。AI模型Data Journalist Agent智能体多模态推荐理由:这个Data Journalist Agent能自动把数据做成带验证的图文视频报道,做数据新闻的不用手动整合多模态了原文稍后读已读值得跟进有用关注 Data Journalist Agent
06:04官方账号NVIDIA AI@NVIDIAAI73°NVIDIA Research 推出 SpatialClaw,一个无需训练的智能体,通过编写 Python 代码作为动作接口。它在持久内核中动态组合感知模块,检查中间结果并跨步骤调整策略。感知输出作为普通变量,可结合 NumPy、SciPy 等库复用。SpatialClaw 在 20 个基准上平均比先前方法高 11.2 分,在 6 种不同模型骨干上表现稳定。AI模型SpatialClawNVIDIA智能体8 个信源在谈事件专题推荐理由:SpatialClaw 不用额外训练,靠写代码搞定复杂视觉任务,在 20 个基准上平均提升 11.2 分,还兼容多种模型。原文稍后读已读值得跟进有用关注 SpatialClaw
00:59AK@_akhaliqJoyAI发布了JoyAI-VL-Interaction模型,这是一个实时视觉语言交互智能系统。该模型支持实时视觉理解与语言生成,能够处理视频帧序列并生成自然语言响应。目前尚未公布具体基准测试成绩或版本号。AI模型JoyAI-VL-InteractionJoyAI多模态推荐理由:JoyAI出了个能实时看懂画面并跟你聊天的模型,适合做交互式AI应用。原文稍后读已读值得跟进有用关注 JoyAI-VL-Interaction
22:28量子位@梦瑶华为鸿蒙小艺AI助手在最新升级中展现了与央视主持人朱广权同台讲脱口秀的能力。新版本具备多模态理解、任务调度和自我进化功能,能根据场景主动调度手机应用和服务。小艺不再只是被动回应,而是能主动理解上下文并执行复杂任务,例如结合日历、天气、备忘录等信息规划行程。此次升级还引入了更强的语音交互和情绪感知能力,让对话更自然。AI产品鸿蒙小艺华为智能体推荐理由:华为小艺升级后能和朱广权说脱口秀,能主动调度应用、自进化,不是普通问答助手,值得试试。原文稍后读已读值得跟进有用关注 鸿蒙小艺
13:41官方账号阿里云 Alibaba Cloud@alibaba_cloudMiniMax 与阿里云 PolarDB 宣布合作探索 AI 原生数据库。PolarDB 为 MiniMax 提供多模态存储、秒级弹性扩容及智能冷热分层能力。该合作旨在应对海量数据与高并发挑战,提升业务敏捷性和用户体验。行业MiniMaxAlibaba CloudPolarDB推荐理由:MiniMax 和阿里云联手了,用 PolarDB 搞定大规模数据,主打秒级弹性和冷热分层。原文稍后读已读值得跟进有用关注 MiniMax
12:38IT之家(博客/媒体)72°苹果 iOS 27 的 AI 版 Siri 上线延迟,项目负责人迈克·罗克韦尔透露,去年已有迭代版本但未达预期,最终决定从零重构。新版 Siri 基于底层大模型,支持多模态交互,覆盖 iPhone、iPad、Mac、Apple Watch、Vision Pro、CarPlay、AirPods 全平台,隐私保护贯穿架构。AI产品AppleSiriiOS 27推荐理由:苹果总算说了实话!Siri 迟到是因为推倒重来,现在能跨设备统一体验还支持多模态,比旧版强太多了。原文稍后读已读值得跟进有用关注 Apple
12:14官方账号arXiv cs.LG@Yonghyun Kim, Junwon Lee, Haiwen Xia, Yinghao Ma, Junghyun Koo, Koichi Saito, Yuki Mitsufuji, Chris DonahueTuneJury 是一个面向文本到音乐生成的开放实例级成对奖励模型,基于人类偏好标签(包括竞技场投票、指标对齐偏好、众包成对比较和专家美学评分)训练。它通过简单分数阈值支持数据过滤,在保留测试对和分布外基准上表现良好,并胜过先前的基线。该模型还引入锚定校准方法,以更高的数据效率恢复一致性,并在三种下游应用(推理时最优N采样、DITTO风格潜在优化和专家迭代后训练)中持续提升奖励轴收益。TuneJury 已在 GitHub 发布。论文TuneJury音乐生成多模态推荐理由:如果你在搞音乐生成,想用人类偏好来对齐模型,这个开源的奖励模型 TuneJury 可以让你直接拿来用,还附带了三种应用示例,比重新训一个省事多了。原文稍后读已读值得跟进有用关注 TuneJury
10:48官方一手arXiv: DeepSeek@Zewen Liu论文发现,当AI智能体使用语言模型在反馈循环中自我评估时,会产生系统性偏好偏差。在多模态环境中,评估者偏好崩溃(EPC)被显著放大:用GPT-4o评估DeepSeek-chat时,单一策略step_by_step吸收48.4%权重,是纯文本自评估崩溃程度的3.2倍,而三个视觉域策略合计仅占9.1%。跨模态传染现象揭示:在一个模态获得的评估者偏好会转移到另一个模态并扭曲策略选择。四阶段隔离训练实验测量了传染系数,并发现跨模态暴露后最优策略发生反转。在53次独立重复、15,592次API调用统计中,跨模型评估产生强对称双向传染(均值γ_{T->V}=1.176, γ_{V->T}=1.089),而自评估(DeepSeek-chat)97%运行传染为零。论文GPT-4oDeepSeek-chat多模态推荐理由:这篇论文用GPT-4o和DeepSeek-chat做实验,发现AI自我评估时策略偏好会崩坏,还跨模态传染,数字很硬核,搞多模态和智能体的值得看。原文稍后读已读值得跟进有用关注 GPT-4o
10:41官方账号arXiv cs.LG@Miso Choi, Seonga Choi, Mincheol Kwon, Woosung Joung, Jinkyu Kim, Jungbeom Lee论文发现,在Vicuna、Qwen2.5、LLaMA2和Mistral等模型家族中,上下文的真实性评分(Truth Scores)在指令微调或多模态适配后高度保留,与其注意头权重继承一致。作者提出TruthProbe软门控策略,通过放大上下文真实头而保留其他头贡献,在HaluEval上提升上下文真实性,并在POPE和CHAIR上减少多模态幻觉。基础LLM的真实头评分有效传递给微调后的LLM和多模态LLM后代。代码已开源。论文TruthProbeVicunaQwen2.5推荐理由:这篇论文挺有意思,发现模型家族里真实头会继承,搞了个TruthProbe来减少幻觉,效果不错,适合研究模型可解释性和幻觉问题的人看。原文稍后读已读值得跟进有用关注 TruthProbe
09:47官方账号arXiv cs.LG@Hangling Xie该论文提出MAF(多模态自适应少样本提示)框架,用于提升多模态大语言模型在情感分析任务中的表现。MAF动态检索与查询相关的演示样本,通过编码面部表情、场景上下文和文本语义,并引入唇动幅度检测机制在多人场景中准确识别说话人。一个轻量级系数生成网络被训练用于实时输出查询条件化融合权重,加权聚合多模态相似度以选取Top-K信息量最大的示例。在多个公开基准数据集上,MAF相比骨干模型取得显著且一致的性能提升,并与强基线方法保持竞争力。论文MAFMLLM情感分析推荐理由:这篇论文提出MAF,能根据输入动态挑选示例来引导MLLM做情感分析,在多个数据集上效果提升明显,比固定提示强很多。原文稍后读已读值得跟进有用关注 MAF
09:45官方账号arXiv cs.AI@Yaoting Huang, Yifu Yuan, Linqi Han, Chengwen Li, Shuoheng Zhang, Xianze Yao, Hongyao Tang, Yan Zheng, Jianye HaoRoboPIN提出PinCoT(固定思维链)方法,将每个推理步骤绑定到视觉锚点,每个锚点包含实体名称、唯一标识、视图索引和空间定位。基于4B参数的小模型,在14个基准测试(涵盖空间推理、多视图推理和指向任务)中,平均超越7B开源模型Mimo-Embodied达12%。该方法通过三阶段后训练注入具身知识和过程监督,显著提升定位精度和跨步骤实体一致性。论文RoboPINPinCoT具身推理推荐理由:这篇论文用4B小模型在具身推理上打败了7B的Mimo-Embodied,平均提高12%,靠的是把每一步推理都牢牢钉在视觉证据上,挺有意思。原文稍后读已读值得跟进有用关注 RoboPIN
09:44官方账号arXiv cs.AI@Maonan Wang, Zhengyan Huang, Kemou Jiang, Yuhang Fu, Jiayue Zhu, Yuxin Cai, Xingchen Zou, Qiaosheng Zhang, Yi Yu, Ding Wang, Xi Chen, Ben M. Chen, Yuxuan Liang, Zhiyong Cui, Man On Pun, Yirong ChenOmniTraffic是一个基于12个真实十字路口重建3D环境的可控生成管道,可编辑车道拓扑、信号相位等参数。它产出800万VQA样本和3000个人工验证的测试集,覆盖场景感知、多视角推理和决策支持三个层级。评估11个前沿MLLM显示人类与模型间存在显著差距,尤其在拓扑和时空推理任务上。基于OmniTraffic模拟数据微调轻量级MLLM后,在真实场景中性能得到提升。论文OmniTraffic交通推理MLLM推荐理由:想研究交通场景的多模态推理?OmniTraffic提供了大规模可控数据集和基准,还能用模拟数据微调小模型提升真实表现,很实用。原文稍后读已读值得跟进有用关注 OmniTraffic
09:37官方一手AWS Machine Learning Blog@Aris Tsakpinis精选Google DeepMind 发布的 Gemma 4 开源权重模型系列现已在 Amazon Bedrock 上可用。该系列包含三个指令调优变体:Gemma 4 31B(密集架构)、26B-A4B(MoE 架构,每次激活 4B 参数)和 E2B。所有变体均支持内置推理、原生函数调用以及文本和图像多模态输入。模型基于 Apache 2.0 许可发布,旨在多种部署场景下实现每参数智能最大化。AI模型Gemma 4Amazon BedrockGoogle DeepMind4 个信源在谈事件专题推荐理由:Google DeepMind 把最新的 Gemma 4 放到 AWS 上了,三种规格可选,带推理和图文理解,正好拿来玩开源项目。原文稍后读已读值得跟进有用关注 Gemma 4
09:22官方账号Runway ML@runwaymlRunway 宣布其视频和图像生成与编辑功能直接集成到 ChatGPT 中,用户无需在标签页之间切换即可使用。该集成支持在 ChatGPT 对话界面内直接调用 Runway 的模型生成视频和图像。Runway 此前已提供文本生成视频、图像编辑等功能,此次与 ChatGPT 的整合简化了工作流程。用户可同时利用 ChatGPT 的对话能力和 Runway 的多模态生成能力。AI产品RunwayChatGPT视频生成推荐理由:Runway 直接嵌进 ChatGPT 里了,不用来回切页面就能生成和编辑视频图片,特别方便。原文稍后读已读值得跟进有用关注 Runway
23:52Julien Chaumond@julien_c83°Mistral AI 正式确认即将发布 Le Chaton Fat,这是一个拥有 30 万亿参数(30T)的混合专家(MoE)模型,配备 256 个专家。该模型支持 1M 上下文窗口,具备多模态和多语言能力,并在所有基准测试上超越 Fable 5。具体发布日期尚未公布。AI模型MistralAILe Chaton FatMoE推荐理由:Mistral 要发一个 30T 参数、256 专家的超大 MoE 模型,还带 1M 上下文和多模态,性能吊打 Fable 5,开源有望了。原文稍后读已读值得跟进有用关注 MistralAI
23:15IT之家(博客/媒体)78°稀宇科技于6月12日开源了 MiniMax M3 模型权重,总参数428B,激活参数23B。M3 是首个从 Step 0 开始进行多模态混合训练的开源模型,支持百万上下文。发布两周后,M3 在 Artificial Analysis 综合智能指数排行榜上获得全球开源模型最高排名。模型输出速度已从30 TPS提升至约80 TPS,后续还将提速30-40%。在编码与智能体评测中达到行业顶尖水平,具备自主任务拆解、工具调用与多步推理能力。AI模型MiniMax M3多模态开源模型2 个信源在谈事件专题推荐理由:MiniMax 开源了原生多模态巨无霸 M3,428B参数、百万上下文,全球开源排名第一,还能自主拆任务调工具,速度从30飙到80 TPS。原文稍后读已读值得跟进有用关注 MiniMax M3
20:12小互@imxiaohuPerceptron AI 发布了 Agentic Detection 模型,用户只需提供一张图片并用自然语言描述目标,模型就能在图中精确框出并标注每个目标。该模型无需预先训练,可直接处理从未见过的检测任务。它还能执行物理推理,例如从森林火灾画面中定位“烟的来源”,识别“需要维修的电线杆”或标记“空着的停车位”。这些能力使其在零样本目标检测领域展现了显著进步。AI模型Perceptron AIAgentic Detection视觉检测推荐理由:Perceptron AI 发了新视觉检测模型,不用提前训练,直接说找什么它就圈出来,还能推理物理关系,挺实用。原文稍后读已读值得跟进有用关注 Perceptron AI
17:50官方账号阿里云 Alibaba Cloud@alibaba_cloud阿里云使用其Qwen和Wan模型创作了一段AI视频,重新演绎墨西哥文化。视频融合了mariachi音乐和Zapotec编织图案等元素。从古老圣地到现代创新中心,展示了AI连接过去与未来的能力。该创作可通过阿里云Model Studio平台体验。AI模型QwenWanAlibaba Cloud推荐理由:阿里云用Qwen和Wan模型做了一个墨西哥文化AI视频,画面很有创意,展示了模型在艺术创作上的能力。原文稍后读已读值得跟进有用关注 Qwen
17:36IT之家(博客/媒体)精选理想在 Livis Day 上宣布马赫 Mind-Pro 模型全面落地 L9。该模型在 IFEval 指令跟随、LongBench-v2 超长文本理解、AIME26 高阶数学推理、BFCL-v4 工具调用等基准上位列第一梯队。其 Token 生成速度、任务完成质量、成本、端到端响应时延达到可量产水平。模型采用多模态流式时序建模,能连续理解动态物理世界并自主决策。所有能力在车端本地完成,数据不上传。AI模型马赫 Mind-Pro理想L9推荐理由:理想把马赫 Mind-Pro 模型塞进 L9 了,指令跟随和推理稳居第一梯队,多模态本地跑还不传数据,车载 AI 这波挺实在。原文稍后读已读值得跟进有用关注 马赫 Mind-Pro
13:02李继刚@lijigang_com许多AI模型在回复中喜欢说“想象一下”。目前很多Agent已支持多模态能力。可以添加一条规则:每当模型输出“想象一下”时,直接生成配图并标注信息。这样能直观呈现模型想表达的画面。该方法利用了Agent的多模态能力来增强表达效果。技巧智能体多模态提示词工程推荐理由:让模型边想边画原文稍后读已读值得跟进有用关注 智能体
11:13官方账号arXiv cs.LG@Rohit Gandikota, David Bau精选论文发现视觉语言模型的LM骨干中存在一组称为gaze heads的注意力头,其注意力会追踪模型当前描述的图像区域。通过仅对top-100个gaze heads(少于全部9%)进行注意力掩码干预,能以83.1%的准确率引导模型描述指定的漫画面板,而随机干预无效。该干预同样适用于自然COCO图像,且机制在2B到32B参数规模及多种VLM架构中复现。该工作展示了通过机制分析实现无需重训的推理时多模态行为操控。论文VLMGaze Heads注意力头推荐理由:操控VLM输出,像翻漫画一样准原文稍后读已读值得跟进有用关注 VLM
11:13官方账号arXiv cs.LG@Constanza A. Molina Catricheo, Simon Boeder, Ting-Jia Guo, Giacomo May, Clément Berthelot, Devis Tuia, Friedrich Fedor Reinhard, Fabio Remondino, Benjamin Risse该研究发布了1.4 TB多模态无人机数据集,覆盖104棵含巢树木,包含27,945张RGB图像、111,780张多光谱图像及约7.81亿个3D点。语义分割基准测试中,Point Transformer V3在测试集上达到86.35% mIoU,优于KPConv和RandLA-Net。数据集结合光谱、空间与结构信息,可支持巢体积估计等生态应用,并为极端类别不平衡下的3D分割算法提供挑战性基准。论文NEST3D多模态3D分割推荐理由:生态数据集,3D分割新基准原文稍后读已读值得跟进有用关注 NEST3D
11:12官方账号arXiv cs.AI@Hui Geng, Yi Su, Han Yin, Tianjiao Wan, Qisheng Xu, Jiaxin Chen, Zijian Gao, Hengzhu Liu, Xie Chen, Kele XuAudioDER是一个约19.1万样本的推理导向后训练数据集,覆盖声音、语音和音乐,每个样本包括音频、多选题、四个候选答案、音频描述和思维链推理。基于声学相似性去重提高多样性,并利用Qwen3-30B生成CoT推理解释。在MMAU-mini、MMSU、MMAR等基准上,使用Qwen2-Audio-7B-Instruct后训练持续提升性能。该数据集开源,旨在推动音频推理研究。AI模型AudioDERQwen3-30BQwen2-Audio-7B-Instruct推荐理由:去重+CoT,提升音频模型推理能力原文稍后读已读值得跟进有用关注 AudioDER
11:10官方账号arXiv cs.AI@Sicheng Yang, Hangjie Yuan, Wenjun Zhang, Jinwang Wang, Yichen Qian, Weihua Chen, Fan Wang, Lei ZhuClinHallu是一个用于诊断医疗多模态大模型(MLLM)推理中分阶段幻觉的基准,包含7031个验证实例。每个实例的推理轨迹被分解为视觉识别、知识回忆和推理整合三个阶段。通过阶段替换干预,可测量纠正特定阶段对最终答案的影响。轨迹监督微调能有效减少阶段幻觉。该基准为诊断和缓解医疗MLLM推理错误提供了细粒度测试平台。AI模型ClinHalluMLLM多模态推荐理由:诊断医疗AI幻觉的利器原文稍后读已读值得跟进有用关注 ClinHallu
07:21官方一手宝玉的分享@宝玉文章指出 Claude Design 的核心能力在于模型能同时处理 UI/UX、数据结构、状态管理和交互逻辑,而非依赖 Harness 工具。Codex 目前缺乏类似产品,因为其模型在跨领域整合上存在差距。作者分析认为,Codex 需要提升模型对多模态和逻辑的协同处理能力,才能推出类似产品。AI模型CodexClaude Design多模态1 个信源在谈事件专题推荐理由:分析 Codex 与 Claude Design 的差距原文稍后读已读值得跟进有用关注 Codex
01:21官方账号Decoder@Jonathan KemperCount Anything 是首个能通过文本提示计数任意图像中物体的 AI 模型,在对比测试中将错误率降低 50%。该模型可处理从人群到显微镜下细胞样本等场景,但在极度密集物体和模糊术语上仍有困难。AI模型Count Anything计数模型多模态推荐理由:计数准确率翻倍原文稍后读已读值得跟进有用关注 Count Anything
22:23rohanpaul_ai@rohanpaul_ai精选73°Nvidia 推出 Cosmos 3,一个能够理解、模拟和行动于多种物理 AI 任务的统一模型。它将动作视为世界的一等语言,把语言、图像、视频、音频和动作整合到一个共享系统中。该模型通过动作标记设计,让机器人能连接所见与可能发生的事,并决定下一步行动。论文显示,Cosmos 3 可基于视频推断动作,或与未来场景一同生成动作,从而解决机器人抓取、滑动等物理交互问题。论文Cosmos 3Nvidia物理AI3 个信源在谈事件专题推荐理由:Nvidia 让机器人学会动作语言原文稍后读已读值得跟进有用关注 Cosmos 3
17:51IT之家(博客/媒体)科大讯飞在2026长三角机器人及自动化展览会上发布星火多模态大模型 X2-VL,这是当前唯一基于全国产算力训练的主流大模型,采用专属 MoE 架构。该模型基于无锡本地算力平台太湖星跃平台加速训练。在高中各科图文试题测试中,X2-VL 答题准确率接近95%。在挑战2026年高考数学全国I卷中,X2-VL 获得148分,超过模型A(144分)和模型B(143分)。AI模型星火X2-VL科大讯飞多模态推荐理由:国产算力训练的模型,高考数学148分原文稍后读已读值得跟进有用关注 星火X2-VL
17:22量子位@一水精选Jiuwen Symbiosis是一个将AI Agent与物理实体结合的框架,通过整合传感器、执行器和实时控制,使Agent能直接与环境交互。该框架在工业机器人测试中实现了90%的任务完成率,相比传统方案提升30%。它支持多模态感知(视觉、触觉、力觉)和动态规划,已在仓储物流场景中部署。实践表明,这种具身智能系统能有效处理非结构化环境中的复杂操作。AI模型Jiuwen Symbiosis智能体具身智能推荐理由:让AI Agent动起来干活原文稍后读已读值得跟进有用关注 Jiuwen Symbiosis