00:32官方账号Simon Willison’s Weblog(博客/媒体)精选77°Mira Murati 创立的 Thinking Machines Lab 发布了首个开源权重模型 Inkling。Inkling 是一个总参数 975B、激活参数 41B 的 MoE transformer,采用 Apache-2.0 许可,训练于 45 万亿 tokens 的文本、图像、音频和视频数据。该模型并非前沿模型,而是定位为通过 Tinker 训练平台进行微调的基础模型。Inkling-Small(276B 总参数, 12B 活跃)仍处于测试阶段,权重将后续发布。模型卡和训练数据文档信息较为简略,但 Inkling 在开源生态中可与 Nemotron 和 Gemma 4 竞争。AI模型InklingThinking Machines Lab开源模型10 个信源在谈事件专题推荐理由:Mira Murati 的新实验室发布了 Inkling,975B 参数的 Apache-2.0 多模态开源模型,专门为微调设计,想折腾的开发者可以试试。原文稍后读已读值得跟进有用关注 Inkling
21:16官方账号LMSYS Org (SGLang)@lmsysorg86°Inkling是thinkymachines发布的首个开源MoE模型,总参数量975B,激活参数41B。它支持最高1M上下文长度,原生处理文本、图像和音频。该模型已获得SGLang和Miles的Day 0支持,采用短卷积、相对位置嵌入注意力和共享专家sink MoE等新架构。推理优化包括DFlash投机解码和MXFP8 KV缓存,并支持全参数和LoRA RL训练。AI模型Inklingthinkymachines开源模型10 个信源在谈事件专题推荐理由:thinkymachines开源了一个超大MoE模型Inkling,总参975B但只激活41B,还支持1M上下文和图文音频理解,已经可以在SGLang上跑了,想玩大模型的朋友可以试试。原文稍后读已读值得跟进有用关注 Inkling
18:46Dify@dify_aiDify 宣布与 AMD 联合举办 AI DevMaster 全球线上黑客马拉松,总奖金池 3 万美元。比赛设三大赛道:Agentic AI、Multimodal AI 和 Physical AI。参赛者可免费使用 AMD Radeon GPU 及 ROCm 软件栈,支持个人或最多 3 人组队。活动面向开发者、研究人员、学生及开源贡献者,现已开放报名。行业DifyAMD黑客马拉松推荐理由:Dify 和 AMD 办比赛了!3 万美元奖金,还能免费用 AMD 显卡搞智能体、多模态或物理 AI,想练手的快去报名。原文稍后读已读值得跟进有用关注 Dify
18:18官方账号Decoder@Matthias Bastian73°由前OpenAI CTO Mira Murati创立的Thinking Machines Lab发布了开放权重多模态模型Inkling,拥有9750亿参数。该模型在Artificial Analysis Intelligence Index上领先所有美国开放权重模型,但中国顶级开源模型(如DeepSeek等)在某些任务上仍表现更优。Inkling定价为每百万输入token 1.87美元,公司将其定位为微调基础模型而非最强通用模型。AI模型InklingThinking Machines LabMira Murati10 个信源在谈事件专题推荐理由:前OpenAI CTO Mira Murati的初创公司推出了9750亿参数的开放权重模型Inkling,性能领先美国同类但不及中国领先模型,适合做微调基础,价格明确。原文稍后读已读值得跟进有用关注 Inkling
16:03官方账号Latent Space (swyx)(博客/媒体)Thinky发布首个完整大语言模型Inkling,总参数量975B,激活参数41B。同时推出小模型Inkling-Small,参数量276B且激活12B。两者均采用Apache 2.0开源许可。Thinky称其为当前美国Apache 2.0许可下表现最佳的开源模型。AI模型InklingThinkyInkling-Small10 个信源在谈事件专题推荐理由:Thinky发了首个模型Inkling,975B参数开源,Apache 2.0协议,据说是美国开源最强。关注开源大模型可以看看。原文稍后读已读值得跟进有用关注 Inkling
15:06Hailuo AI@Hailuo_AIMiniMax于SIGGRAPH 2026(7月22日)发表演讲。VP RenLeanna将探讨原生多模态模型如何连接理解跨模态(如文本、图像、视频)。该技术旨在赋能更丰富的AI系统和创意工作流。行业MiniMaxHailuo_AISIGGRAPH推荐理由:MiniMax要去SIGGRAPH了,听听他们怎么打通文字、图片、视频的多模态理解,对做AI创作的人很有启发。原文稍后读已读值得跟进有用关注 MiniMax
14:51IT之家(博客/媒体)78°Thinking Machines Lab发布Inkling多模态AI模型,采用混合专家架构,总参数975B、激活41B,上下文长度1M tokens,预训练数据达45万亿 tokens。与中国开源模型对比:GLM 5.2在SWEBench Pro得分62.1%高于Inkling的54.3%,DeepSeek V4 Pro在SWEBench Verified达80.6%领先Inkling的77.6%,但Inkling在AIME 2026数学测试以97.1%超越DeepSeek的96.7%。与美国对手Nemotron 3 Ultra相比,Inkling在AIME 2026和SWEBench Verified分别领先2.9和6.9个百分点。面对闭源模型Claude Fable 5等,Inkling在编码推理上落后,但多模态视觉(MMMU Pro 73.3%)和音频(MMAU 77.2%)仍具竞争力。AI模型InklingThinking Machines LabMira Murati10 个信源在谈事件专题推荐理由:前OpenAI CTO创业首秀,开源975B参数多模态模型,多模态有亮点,但推理编程弱于GLM和DeepSeek,看看值不值得用。原文稍后读已读值得跟进有用关注 Inkling
12:45官方一手歸藏(guizang.ai)@op741887°Thinking Machine 推出首款模型 Inkling,采用 MoE 架构,总参数量 975B,激活参数 41B,上下文窗口达 1M。模型在 45T 数据上训练,原生支持文本、图像和音频理解。同时发布 Small 预览版,激活参数 12B,且模型开源。后训练数据从 Kimi 2.5 等开源模型蒸馏得到。AI模型Thinking MachineInklingMira Murati10 个信源在谈事件专题推荐理由:Mira Murati 新公司出了开源多模态模型,近 1T 参数但只激活 41B,支持 1M 上下文,还能自己微调,值得试试。原文稍后读已读值得跟进有用关注 Thinking Machine
12:39Junyang Lin@JustinLin610Thinking Machines 推出名为 Inkling 的新模型,支持文本、图像和音频三种模态的推理。Inkling 的完整权重已开放,可在 Tinker 平台进行微调。用户还能通过 Inkling Playground 直接体验模型。该模型发布后获得了社区关注,原推文作者点赞其新架构。AI模型InklingThinking Machines多模态10 个信源在谈事件专题推荐理由:Thinking Machines 发了 Inkling,一个能看图文听音频的推理模型,而且权重全开放,能自己微调,还能在 Playground 试玩。原文稍后读已读值得跟进有用关注 Inkling
11:01shao__meng@shao__meng76°Thinking Machines(OpenAI前CTO Mira Murati团队)开源多模态模型Inkling,采用975B参数A41B MoE架构。在开源模型中,Inkling强于Nemotron 3 Ultra和Kimi K2.5,与Kimi K2.6、DeepSeek V4 Pro互有胜负:在IFBench、FORTRESS、SWEBench Verified上略胜,在HLE、SimpleQA、Terminal Bench上略输。整体弱于GLM 5.2,后者在多项基准领先。与闭源模型比,Claude Fable 5和GPT 5.6 Sol在agentic coding和推理上明显领先(SWEBench Verified 95% vs 77.6%),但Inkling在指令遵循上反超(IFBench 79.8% > Claude 63.5%)。AI模型InklingThinking Machines多模态10 个信源在谈事件专题推荐理由:Mira Murati团队开源了多模态模型Inkling,975B参数,比Nemotron和Kimi K2.5强,指令遵循甚至超Claude,值得一试。原文稍后读已读值得跟进有用关注 Inkling
07:51官方一手marktechpost@Asif Razzaq74°2026年7月15日,Thinking Machines Lab 发布其首个从头训练的模型 Inkling。Inkling 拥有 975B 总参数、41B 激活参数,采用 Mixture-of-Experts 架构,原生支持文本、图像和音频输入,上下文窗口达 1M token。模型权重基于 Apache 2.0 许可开源,实验室明确它并非当下最强模型,而是定位为定制基础,其可控思考努力(Controllable Thinking Effort)是主要差异化功能。AI模型InklingThinking Machines LabMoE10 个信源在谈事件专题推荐理由:Inkling 让你能控制模型思考深度,975B 参数但只激活 41B,适合做定制化基础模型。原文稍后读已读值得跟进有用关注 Inkling
06:28Fireworks AI@FireworksAI_HQFireworks AI 宣布提供 Thinky Machines 的首个开源权重模型 Inkling,该模型为 975B MoE 架构,支持多模态,采用 Apache 2.0 许可证。Inkling 专为微调设计,提供 day-zero 访问,可在 Fireworks AI 平台使用。AI模型Thinky MachinesInklingFireworks AI10 个信源在谈事件专题推荐理由:Thinky Machines 开源了 975B MoE 多模态模型 Inkling,Apache 2.0 随便用,适合微调,直接在 Fireworks 上跑。原文稍后读已读值得跟进有用关注 Thinky Machines
04:27lmarena.ai@lmarena_ai精选Thinking Machines 发布 Inkling,支持文本、图像和音频三种模态。Inkling 已加入 Agent Arena,该基准使用数百万全球用户的长时任务评估智能体,任务涉及网络搜索、文件系统和终端操作。Inkling 也参与文本、视觉和代码竞技场。Inkling 完整权重开放,可在 Tinker 平台进行微调。AI模型InklingThinking MachinesAgent Arena10 个信源在谈事件专题推荐理由:Thinking Machines 出了个新模型 Inkling,能同时处理文字、图片和音频,还在 Agent Arena 上测了长期任务能力。现在能免费下载权重自己微调,可以试试。原文稍后读已读值得跟进有用关注 Inkling
03:57The Rundown AI@therundownai精选Thinking Machines 推出了其首个模型 Inkling,这是一个开源权重的多模态系统。Inkling 拥有高达 100 万 token 的上下文窗口,能够原生处理文本、图像和音频,并支持可控思考努力。完整权重已在 Hugging Face 上公开,并可通过 Tinker 平台进行微调。团队表示 Inkling 不是整体最强的模型,但专为定制化而设计。AI模型Thinking MachinesInkling多模态10 个信源在谈事件专题推荐理由:想找个能处理百万 token 多模态、还能自己微调的开源模型?Inkling 刚上线,权重直接开放,值得试试。原文稍后读已读值得跟进有用关注 Thinking Machines
03:51官方账号Greg Brockman@gdb用户称GPT-5.6 Sol是迄今为止最令人印象深刻的模型。在编程之外的数学和视觉能力方面,Sol(Max)表现极佳。测试显示Sol和Terra在视觉数学上远优于其他模型。这些改进非常显著。AI模型GPT-5.6 SolOpenAI多模态10 个信源在谈事件专题推荐理由:有人实测了GPT-5.6 Sol,数学和视觉超强,比Terra和其他模型厉害很多,值得关注。原文稍后读已读值得跟进有用关注 GPT-5.6 Sol
03:46Suhail@Suhail精选Thinking Machines 今日推出多模态模型 Inkling,支持文本、图像和音频三种模态的高效推理。该模型完全权重开放,允许用户在 Tinker 平台上进行微调。官方同时提供 Inkling Playground 供用户体验。这一发布标志着后训练基础设施即服务的垂直整合进入新阶段。AI模型InklingThinking Machines多模态10 个信源在谈事件专题推荐理由:Inkling 能同时处理文本、图像和音频,权重全开放还能自己微调,去 Playground 玩一把就知道了。原文稍后读已读值得跟进有用关注 Inkling
03:42Paul Couvert@itsPaulAiThinking Machines发布了开源模型Inkling,采用Apache 2.0许可。Inkling为多模态模型,支持文本、图像和音频,拥有41B活跃参数。在Design Arena上其性能与GPT-5.6 Sol相当。公司还计划推出12B参数的Inkling-Small版本。Inkling提供完整权重,并可在Tinker平台微调。AI模型InklingThinking MachinesGPT-5.6 Sol10 个信源在谈事件专题推荐理由:Thinking Machines出了个真开源的多模态模型Inkling,41B参数能和GPT-5.6 Sol掰手腕,还准备出12B小版,赶紧试试。原文稍后读已读值得跟进有用关注 Inkling
03:40elvis@omarsar0精选Thinking Machines推出Inkling,一个975B参数(41B活跃)的MoE Transformer模型。它原生支持文本、图像和音频多模态处理。上下文长度提供64K和256K两种版本。完整权重已开放,可在Tinker平台进行微调。用户还能通过Inkling Playground直接体验。AI模型InklingThinking MachinesMoE10 个信源在谈事件专题推荐理由:Thinking Machines开源了975B参数的MoE模型Inkling,支持多模态和64K/256K长上下文,还能在Tinker上微调,值得试试。原文稍后读已读值得跟进有用关注 Inkling
03:39Lilian Weng@lilianwengThinking Machines 发布 Inkling 模型,提供完整开源权重。该模型在文本、图像、音频三种模态上均具备高效推理能力。用户可在 Tinker 平台上直接进行微调。基准性能覆盖广泛能力类别,适合实际应用与定制开发。AI模型InklingThinking Machines多模态10 个信源在谈事件专题推荐理由:Thinking Machines 开源了 Inkling,能同时处理文本、图像和音频,还能在 Tinker 上微调,挺实用的。原文稍后读已读值得跟进有用关注 Inkling
03:02官方账号vLLM@vllm_project84°Thinking Machines Lab发布了TML Inkling,一个1T参数的开源权重模型,支持文本、图像和音频多模态输入。其上下文窗口高达100万token,采用相对注意力、短卷积和MoE专家汇聚的新架构,并配备8个MTP头用于推测解码。vLLM已从首日支持该模型,在NVIDIA Blackwell和Hopper上运行,4×GB200 MTP可达380 tok/s/user。AI模型TML InklingThinking Machines LabvLLM10 个信源在谈事件专题推荐理由:1T参数的开源多模态模型,百万token上下文,vLLM直接跑,4×GB200飙到380 tok/s,值得试试。原文稍后读已读值得跟进有用关注 TML Inkling
03:00官方账号NVIDIA AI@NVIDIAAI精选Thinking Machines 推出开源模型 Inkling,支持文本、图像和音频三模态推理。模型基于 NVIDIA GB300 NVL72 训练,NVFP4 检查点已在 Hugging Face 开放下载。官方提供完整权重,并支持通过 Tinker 平台进行微调,用户也可在 Inkling Playground 直接体验。AI模型InklingThinking MachinesNVIDIA10 个信源在谈事件专题推荐理由:Thinking Machines 刚发了 Inkling,一个开源的多模态推理模型,能处理文本、图像、音频,还给了完整权重可以微调,NVFP4 检查点直接下。原文稍后读已读值得跟进有用关注 Inkling
22:20官方账号Together AI@togethercompute精选PrismML发布了Bonsai 27B,一个270亿参数的多模态模型,能在手机级设备上本地运行。该模型采用三元量化技术压缩体积,同时保留图像理解等多模态能力。用户现可通过Together AI平台在线试用。这是本地AI在参数量和设备适配上的重要进展。AI模型Bonsai 27BPrismMLTogether AI推荐理由:27B参数的多模态模型能塞进手机?Bonsai 27B做到了,性能还很强,快试试。原文稍后读已读值得跟进有用关注 Bonsai 27B
19:42berryxia@berryxia88°阿里千问将作为AI能力集成至Apple智能,覆盖iOS、iPadOS、macOS和visionOS的中国用户。用户无需切换应用即可在苹果设备上体验千问的文本与图像理解、内容生成等能力。同日,网信办发布7款手机端侧生成式AI服务备案信息,包括苹果智能、华为小艺大模型、OPPO AndesGPT等。AI产品阿里千问Apple智能多模态5 个信源在谈事件专题推荐理由:阿里千问和苹果合作了,以后用iPhone、iPad直接就能用千问的文本和图像功能,不用再跳转应用了。原文稍后读已读值得跟进有用关注 阿里千问
16:54IT之家(博客/媒体)小米自研 MiMo 模型已完成大语言、多模态、语音等全系列模型矩阵闭环,并通过国家端侧大模型备案。该模型采用端云协同架构,将全面赋能人车家全生态。小米计划 2026 年在 AI 领域投入 160 亿元,未来三年 AI 总投入不低于 600 亿元。AI模型小米MiMo端侧模型推荐理由:小米的 MiMo 模型正式备案了,端侧大模型覆盖语言、多模态、语音多种能力,还计划砸 600 亿搞 AI,快来看看他们的布局。原文稍后读已读值得跟进有用关注 小米
14:30IT之家(博客/媒体)谷歌图片服务于2001年7月上线,2011年推出以图搜图功能,现已迎来25周年。谷歌在AI概览中新增图像生成功能,基于Nano Banana模型将文本提示转化为原创图片。该功能将在未来几周内向英文版用户开放。AI产品谷歌图片Nano Banana图片生成推荐理由:谷歌直接在搜索AI概览里加了个图片生成器,用Nano Banana模型把文字变图片,省得你满网找图了。原文稍后读已读值得跟进有用关注 谷歌图片
11:32IT之家(博客/媒体)76°阿里巴巴发布Qwen-Audio-3.0-Realtime实时语音交互对话模型,提供推理更强的Plus版本和速度更快的Flash版本。模型在S2S语音指令遵循公开基准VStyle上取得SOTA效果,并在Artificial Analysis子项综合排名第一,超越OpenAI GPT-Realtime-2。支持动态工具调用(如路线规划、信息查询)、音色克隆以及情感感知生成,能根据语境调整语气、节奏和情感。适用于智能客服、教育培训、娱乐互动等场景。AI模型阿里巴巴Qwen-Audio-3.0-Realtime实时语音10 个信源在谈事件专题推荐理由:阿里新模型Qwen-Audio-3.0-Realtime能实时语音对话、调用工具、感知情绪,语音指令和综合排名都超过了GPT-Realtime-2。原文稍后读已读值得跟进有用关注 阿里巴巴
11:09官方账号arXiv cs.LG@Zhuoyuan Li, Yue Zhao, Ming Li精选论文提出集成控制流滤波(EnCF)用于隐式数据同化,通过随机控制流和伴随匹配学习观测依赖控制。针对模拟器定义观测,EnCF-LF从样本学习替代条件能量。理论证明理想精确性并建立一步误差分解。数值实验显示,EnCF在非高斯、多对一、多模态和隐式观测模型上优于Kalman型滤波器。论文EnCF数据同化隐式模型推荐理由:处理非高斯多模态观测数据?试试这篇的EnCF方法,比传统卡尔曼滤波灵活。原文稍后读已读值得跟进有用关注 EnCF
10:59官方账号arXiv cs.AI@Ruoran Xu, Wending Gao, Qiufeng WangFormalAnalyticGeo 是一个可扩展的框架,利用 CDL(条件描述语言)作为形式中间表示,通过 SDF(符号距离场)引擎连接问题文本与精确图形渲染。框架包含四个 LLM 组件:Generator、Formalizer、Measurer 和 Quality Verifier,实现全自动闭环生成,无需人工标注。基于该框架构建的 AnalyticGeo7K 数据集包含超过 7,000 个经过验证的多模态问题,其中位相对误差为 0.70%,82.3% 的答案与精确符号解偏差在 5% 以内。论文表明该方法在解析几何问题生成上优于现有模板和生成模型。论文FormalAnalyticGeoCDL解析几何推荐理由:想要自动生成带精确几何图形的数学题?FormalAnalyticGeo 用 CDL 形式语言和 SDF 渲染,造出了 7000+ 带标注的解析几何题目,误差不到 1%。原文稍后读已读值得跟进有用关注 FormalAnalyticGeo
09:19官方账号arXiv cs.AI@Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge论文针对多模态情感识别(MER)中大模型(如7B参数)推理慢、难以部署的问题,提出轻量级框架Light-MER,模型参数小于1B。通过知识蒸馏将大教师模型的知识迁移至学生模型,引入两种优化策略:基于Sliced Wasserstein距离与隐藏状态对齐的最优传输损失,以及基于GRPO的多奖励优化以平衡性能与效率。在9个基准数据集上,Light-MER取得SOTA性能,同时推理速度显著提升。代码已在GitHub开源。论文Light-MER知识蒸馏多模态推荐理由:他们挑战了多模态情感模型必须大的假设,用知识蒸馏搞出<1B的Light-MER,9个基准超了大模型还更快,做部署的可以看看。原文稍后读已读值得跟进有用关注 Light-MER
08:53Paul Couvert@itsPaulAiPrismML今天推出Bonsai 27B,首个能在手机上运行的27B参数多模态模型。基于Qwen3.6 27B,提供两个变体:三元版5.9GB(1.71位/权重)和1-bit版3.9GB(1.125位/权重)。该模型支持多步推理、结构化工具使用和长上下文智能体循环。全部代码和权重已开源(Apache 2.0),此前运行类似模型需要千美元级电脑。AI模型Bonsai 27BPrismMLQwen3.6推荐理由:27B模型能塞进手机,3.9GB就跑得动,还完全开源。手机党不用再羡慕桌机了。原文稍后读已读值得跟进有用关注 Bonsai 27B
08:41berryxia@berryxia精选72°OpenMOSS 发布 MOSS-VL-Realtime,一个 11B 参数的多模态模型,支持实时视频流交互,可边接收视频边生成回复。采用 Cross-Attention 架构和 XRoPE 位置编码,支持 256K 上下文窗口,兼容文本、单图/多图、视频及图文交错输入。在流式视频理解基准上达到开源模型领先水平,主动预警和及时响应能力突出。同时开源 MOSS-VL-0708 Instruct,在细粒度感知和长视频理解任务上有明显提升。所有模型以 Apache-2.0 协议开源,支持本地部署和实时推理。AI模型OpenMOSSMOSS-VL-Realtime多模态推荐理由:OpenMOSS 发了能边看视频边聊天的实时多模态模型,11B 参数开源可部署,适合做监控、直播等持续视频理解应用。原文稍后读已读值得跟进有用关注 OpenMOSS
08:37berryxia@berryxiaPrismML发布Bonsai 27B,这是首个能在手机上本地运行的27B级多模态模型。该模型通过端到端低比特技术,1-bit版本仅3.9GB,可在iPhone 17 Pro上运行;Ternary版本5.9GB,适合笔记本。其智能密度达0.53 per GB,比全精度基线高约10倍,比现有最佳低比特方案高2.7倍。在15个基准测试中,Ternary版平均保留95%性能,1-bit版保留90%,数学、编码和工具调用能力接近原版Qwen3.6 27B。模型已开源(Apache 2.0),支持GGUF格式,提供一键运行Demo和免费开发者预览API。AI模型Bonsai 27BPrismML多模态推荐理由:PrismML搞了个Bonsai 27B,在手机上就能跑27B多模态模型,压缩到3.9GB性能还能保留90%,挺牛的,还开源了,可以试试。原文稍后读已读值得跟进有用关注 Bonsai 27B
05:49官方账号Meta AI@AIatMeta72°Meta AI 提交其推理与多模态模型参加了亚洲物理奥林匹克(APhO)理论考试。该模型取得满分 30/30 的成绩,与排名前三的学生选手并列。APhO 委员会允许该模型参赛,展示其在复杂物理推理任务上的能力。AI模型Meta AI推理模型多模态推荐理由:Meta 的模型在物理奥赛里拿了满分,和前三名人类选手并列,看看AI的理科能力有多强。原文稍后读已读值得跟进有用关注 Meta AI
04:39elvis@omarsar0精选PrismML 今日发布 Bonsai 27B,这是首个可在手机上本地运行的 27B 参数多模态模型。基于 Qwen3.6 27B,Bonsai 27B 支持多步推理、结构化工具使用、长上下文和智能体循环。Ternary 变体仅 5.9 GB(1.71 有效比特/权重),1-bit 变体仅 3.9 GB(1.125 有效比特/权重),大幅降低本地部署门槛。在 RTX 5090 上,1-bit 版本达到 163 tok/s,Ternary 版本达到 134 tok/s;在 M5 Max 上分别为 87 tok/s 和 58 tok/s。模型以 Apache 2.0 许可证开源。AI模型Bonsai 27BPrismMLQwen3.6推荐理由:手机能跑 27B 模型了?PrismML 的 Bonsai 27B 实际做到了——体积最小 3.9GB,速度还不慢,开源免费。想本地用大模型又嫌大的可以看。原文稍后读已读值得跟进有用关注 Bonsai 27B
12:43量子位@梦瑶某团队发布了视频Agent产品,内置超过100个导演级技能,用户可随时调用。该Agent能够辅助视频创作全流程,从分镜到剪辑提供专家级建议。这是首个达到可用级别的视频Agent产品,标志着AI视频生成进入实用阶段。AI产品视频Agent100+Skill视频生成推荐理由:有个视频Agent产品,集成了100多个导演级技能,能直接帮你做视频创作,随叫随到,很实用。原文稍后读已读值得跟进有用关注 视频Agent
12:26官方账号arXiv cs.AI@Shijie Wang, Honglu Zhou, Ziyang Wang, Ran Xu, Caiming Xiong, Silvio Savarese, Chen Sun, Juan Carlos Niebles当前视频大语言模型在问答中表现优异但缺乏可验证的视觉依据。研究人员提出E-VQA(Evidence-Backed Video Question Answering)新任务,要求模型同时输出语义答案和精确的时空证据:时间片段与密集跟踪物体分割掩码。为此构建了首个经人工验证的像素级定位基准ST-Evidence,包含判别与生成两种任务。对现有模型的评估显示,问答准确率与真实视觉感知之间存在显著脱节,仅靠扩展规模无法解决。团队开发了自动化生成流程,创建16万规模的ST-Evidence-Instruct数据集,微调后的7B模型在UniPixel基线上获得+27.2 t-mean和+13.8 J&F的提升。论文E-VQAST-EvidenceSalesforce AI Research推荐理由:Salesforce AI Research 发布了 E-VQA 任务和 ST-Evidence 基准,解决了视频问答无法验证视觉证据的问题。如果你想理解视频模型真正“看到”了什么,这篇论文值得一读。原文稍后读已读值得跟进有用关注 E-VQA
12:19官方账号arXiv cs.AI@Yu-Han Huang, Chih-Kai Yang, Ke-Han Lu, An-Yu Cheng, Hung-yi LeeIAAN(Identifying and Amplifying Acoustic Neurons)是一种无需训练和标签的方法,通过对比真实波形与噪声参考的激活值,对音频编码器中的每个前馈神经元进行评分并放大得分最高的少量神经元。在10种非语义语音属性上,IAAN在Audio-Flamingo-3上平均准确率提升25.7个百分点,在Qwen2.5-Omni上提升21.4,在Kimi-Audio上提升9.7。实验表明,仅在编码器内部以神经元级粒度干预才能产生增益,而解码侧或语言模型内部干预效果微弱甚至退化。该方法还能进一步改善已经专门微调用于强调声学证据的模型。论文IAANAudio-FlamingoQwen2.5-Omni推荐理由:想提升音频模型对语气、情感等非语义信息的识别?试试IAAN,在不重训模型的情况下,通过对编码器内部特定神经元做微调就能显著提分,多模型实测有效。原文稍后读已读值得跟进有用关注 IAAN
11:46官方一手arXiv: OpenAI@Sheng Li, Jing Li, Felix Schijve, Jun Hu, Emilia Barakova本文综述了自动语音识别(ASR)在机器人系统中的集成方法,涵盖在线API和本地模型两种方案。重点分析了从传统方法到OpenAI Whisper等深度学习模型的演变,并列举了LibriSpeech、Common Voice等大规模数据集以及Kaldi、ESPnet等开源工具包。系统梳理了基于ROS、云服务和混合架构的部署策略,以及Pepper、NAO等真实机器人平台的应用案例。最后探讨了在动态嘈杂环境中实现多模态交互的挑战,为社交机器人研究者提供了语言交互领域的导航。论文WhisperROS语音识别7 个信源在谈事件专题推荐理由:这篇综述把机器人语音识别的在线API和本地模型方案都讲透了,尤其适合想用Whisper做离线识别的开发者,ROS集成部分很有实操参考。原文稍后读已读值得跟进有用关注 Whisper
10:59岚叔@lufzzlizGoogle 计划于本周17日发布新模型 Gemini 3.5。据称在内部测试中,Gemini 3.5 性能超越 GPT-5.6 和 Fable 5。相比上一代 Gemini 3.1 Pro,新模型有显著提升。具体基准成绩未公开。AI模型Gemini 3.5GoogleGPT-5.67 个信源在谈事件专题推荐理由:Google 的新模型 Gemini 3.5 本周就要来了,内部测试居然超过了 GPT-5.6 和 Fable 5,比前代 Pro 版强不少。原文稍后读已读值得跟进有用关注 Gemini 3.5
19:46官方账号Decoder@Jonathan Kemper精选德国研究联盟发布开源语言模型Soofi S 30B-A3B,基于德国电信慕尼黑云基础设施训练。该模型采用高效混合架构,每次调用仅激活316亿参数中的部分,长文本下保持稳定吞吐量。训练数据刻意偏向德语,在德语和英语基准测试中均超越所有完全开源竞品。AI模型Soofi S开源模型德语推荐理由:德国团队搞了个30B开源模型,英德双语都很强,还只用了德国电信的本地云算力,跑长文本也不掉速。原文稍后读已读值得跟进有用关注 Soofi S