12:05官方账号arXiv cs.AI@Peter Schneider-Kamp, Jacob Nielsen, Gianluca Barmina, Kenneth Enevoldsen, Lukas Galke PoechDFM Mimir v1是丹麦基础模型团队发布的10亿参数语言模型,基于HRM架构从零训练。该模型仅使用许可的后训练数据,混合了161个数据集进行训练。在20个英语、数学与代码及丹麦语基准上,Mimir v1超过HRM-Text 1B,并可与Qwen 3.5 4B和Gemma 4 E2B竞争。它在丹麦语任务上刷新了最先进水平,模型现已在Hugging Face Hub开放下载。AI模型DFM MimirHRMQwen 3.51 个信源在谈事件专题推荐理由:丹麦团队开源了10亿参数的Mimir v1,只用合规数据就追上4B模型,丹麦语还是第一。原文稍后读已读值得跟进有用关注 DFM Mimir
17:55官方账号NVIDIA AI@NVIDIAAIUniphore实测NVIDIA Nemotron 3.5 Lightning在企业级智能体工作负载中的表现。与参数规模相近的Gemma 4 31B IT相比,Nemotron 3.5 Lightning吞吐量提升5倍,准确率也有明显增长。Uniphore已将其纳入Business AI Cloud高流量路径的评估范围。AI模型Nemotron 3.5 LightningNVIDIAGemma 410 个信源在谈事件专题推荐理由:NVIDIA新模型在企业任务上直接碾压Gemma 4,吞吐量翻5倍,跑真实负载的数据很硬核。原文稍后读已读值得跟进有用关注 Nemotron 3.5 Lightning
06:33Google AI Developers@googleaidevsGoogle工程师用Antigravity在赛道上进行代码的实时迭代,并搭建实时遥测管道。Agent Development Kit(ADK)负责管理多智能体任务。Gemma 4模型在Pixel 10的TPU上本地运行,提供零延迟的音频教练提醒。这套方案支持离线推理,无需联网即可工作。技巧AntigravityADKGemma 43 个信源在谈事件专题推荐理由:Google这波玩法挺新鲜:Antigravity写代码、ADK管多智能体,Gemma 4直接离线跑在Pixel 10上做实时语音教练,响应很快。原文稍后读已读值得跟进有用关注 Antigravity
18:25官方账号Decoder@Jonathan KemperGoogle DeepMind将Gemma 4改造成扩散模型DiffusionGemma,训练成本不到原始预算的10%。该模型一次并行生成256个token,推理速度约每秒1500个token。在基准测试中,DiffusionGemma的质量仍落后于原始自回归模型,尤其在推理任务上差距明显。AI模型DiffusionGemmaGemma 4Google DeepMind3 个信源在谈事件专题推荐理由:Google DeepMind把Gemma 4改装成扩散模型DiffusionGemma,训练便宜十倍,生成快,但推理质量比原版差。适合想低成本做扩散模型的人看看。原文稍后读已读值得跟进有用关注 DiffusionGemma
09:29官方一手arXiv: DeepSeek@Ahmed Ryan, Md Erfan, Akond Ashfaque Ur Rahman, Md Rayhanur Rahman一项初步研究让6个开源权重LLM各尝试证明CoqStoq基准中的100个定理,每个定理只有一次机会,温度设为0,并用Coq内核验证结果。Gemma 4成功验证12个定理,Llama 3.3验证8个,DeepSeek Coder V2 Lite验证1个,Qwen 3.5、Mistral Small 3.1和GPT-OSS均未通过验证。全部21个成功结果覆盖15个不同定理,其中11个是标准Coq策略未能解决的。所有被验证的定理都只有短或中等人写参考证明,长证明定理无一成功。600次尝试中共产生21个内核验证证明,总体成功率3.5%。论文CoqGemma 4Llama 3.3推荐理由:这几个开源模型里Gemma 4最会写Coq证明,但100道题也只过12道,别指望它们太靠谱。原文稍后读已读值得跟进有用关注 Coq
15:38AI Will@FinanceYF5Gemma 4新增读图功能,可分析截图、手写笔记和报错信息。模型下载后完全本地运行,每次对话推理成本为零。用户只需承担电费和硬件损耗。这使Gemma 4成为低成本的本地多模态模型选择。AI模型Gemma 4Google多模态1 个信源在谈事件专题推荐理由:Google的Gemma 4能本地读图分析截图和手写笔记,而且每次对话零推理成本,比云端模型省大钱。原文稍后读已读值得跟进有用关注 Gemma 4
15:21AI Will@FinanceYF5该教程介绍如何在16GB内存的笔记本上通过Ollama本地运行Google的Gemma 4模型,无需订阅或API密钥。第一步安装Ollama(支持Mac、Windows、Linux),第二步运行gemma4:e4b(约9.6GB下载),若内存不足可改用gemma4:e2b。可选步骤可增加上下文至8192 tokens,并设置本地模式禁用Ollama云功能。本地运行后无每次提示的API费用,仅消耗硬件电力。技巧Gemma 4Ollama本地模型1 个信源在谈事件专题推荐理由:手把手教你在16GB笔记本上免费跑Gemma 4,无需云端、完全离线,连API费都省了。原文稍后读已读值得跟进有用关注 Gemma 4
10:33SuperTechFans(博客/媒体)精选TurboFieldfare 是一个采用 Swift 和 Metal 编写的开源推理运行时,专为 Apple Silicon Mac 设计。它通过 SSD 流式加载专家权重,使 Gemma 4 26B-A4B 模型仅需约 2GB 内存即可运行,无需加载完整的 14.3GB 模型。实测在 8GB M2 MacBook Air 上达到 5.1-6.3 tok/s,在 24GB M5 Pro 上达到 31-35 tok/s。项目提供本地 Mac 应用、CLI 和 OpenAI 兼容服务器,要求 macOS 26、Metal 4 和 Xcode 26。AI模型TurboFieldfareGemma 4Apple Silicon10 个信源在谈事件专题推荐理由:想在老 Mac 上跑大模型?这个开源引擎让 Gemma 4 26B 只需 2GB 内存就能跑起来,M2 上还有 5-6 tok/s,挺实用的。原文稍后读已读值得跟进有用关注 TurboFieldfare
10:29Jerry Liu@jerryjliu0Ramp Labs 开源了 PorTAL 框架,用于共享任务表示和跨模型 LoRA 适配。该框架目前支持 Gemma 4 E2B、Mistral 7B 和 Thinky Machines 的 Inkling 模型,覆盖混合注意力模型和多模态系统。代码已在 ramp-public/portallib 仓库中公开,模型托管于 Hugging Face 的 RampPublic 组织。AI模型PorTALRamp LabsLoRA1 个信源在谈事件专题推荐理由:如果你做 LoRA 微调或想用一个框架搞定 Gemma、Mistral 和 Inkling 多个模型的适配,可以看看 Ramp 开源的 PorTAL。原文稍后读已读值得跟进有用关注 PorTAL
09:24官方一手marktechpost@Michal Sutter文章对比了6款在单张24GB GPU上以Q4_K_M量化运行的开放权重模型,包括Qwen3.6、Gemma 4、Mistral Small、gpt-oss-20b和DeepSeek-R1-Distill。每个模型列出了VRAM占用、许可协议和擅长任务。例如Qwen3.6在代码生成方面表现突出,DeepSeek-R1-Distill推理能力较强。读者可根据需求选择适合的本地模型。技巧Qwen3.6Gemma 4Mistral Small1 个信源在谈事件专题推荐理由:想用24GB显卡跑本地模型?这篇文章直接对比了6款主流开源LLM,告诉你选哪个干哪种活,省得自己试。原文稍后读已读值得跟进有用关注 Qwen3.6
22:19berryxia@berryxia精选73°Google更新Gemma 4,修复历史轮次处理、思考保留、工具输出延续和工具调用一致性问题。预填充速度提升25-70%。Unsloth跟进发布GGUF、MLX和NVFP4量化版本,支持本地部署。此次更新解决了Gemma之前工具调用不稳定或卡住的痛点。AI模型Gemma 4GoogleUnsloth3 个信源在谈事件专题推荐理由:Google刚修了Gemma 4工具调用的老毛病,速度还快了25-70%,Unsloth立马出了量化版能本地跑,做Agent的兄弟可以试试。原文稍后读已读值得跟进有用关注 Gemma 4
03:15ollama@ollama精选Ollama 0.32.1 版本针对 Gemma 4 模型优化了 tool calling 能力,提升了在 coding agents 中的可靠性。用户可通过 `ollama launch pi --model gemma4:26b` 运行 Gemma 4 26B 模型,或使用 MLX 引擎(`--model gemma4:26b-mlx`)获得最高性能。该更新基于社区反馈,修复了多项问题。AI产品OllamaGemma 4tool calling3 个信源在谈事件专题推荐理由:Ollama 更新让 Gemma 4 在编码代理中调用工具更稳了,跑 26B 模型还支持 MLX 加速,值得试。原文稍后读已读值得跟进有用关注 Ollama
22:13小互@imxiaohuGemma 4支持140多种语言,开箱即用即可使用35种以上语言,包括中文。在LiveKit Agents中切换至Gemma 4 31B只需一行配置,调整模型指向即可。该模型专为多语言语音Agent场景优化,提供广泛的覆盖能力。AI模型Gemma 4LiveKit Agents多语言3 个信源在谈事件专题推荐理由:用LiveKit搭语音Agent?改一行配置就能切到Gemma 4 31B,支持140多种语言,中文也在内。原文稍后读已读值得跟进有用关注 Gemma 4
22:06小互@imxiaohu精选LiveKit 在其推理平台 LiveKit Inference 上推出针对 Google Gemma 4 31B 的优化服务。实时语音场景中,首字延迟低至192毫秒,比GPT-4.1的1006毫秒快5.2倍。成本降低约83%,约为GPT-4.1的六分之一。在酒店前台场景测试中,任务完成率达88%,超过GPT-4.1(73%)和Gemini 2.5 Flash(64%)。AI产品LiveKitGemma 4GPT-4.13 个信源在谈事件专题推荐理由:LiveKit 用 Gemma 4 31B 做实时语音,延迟比 GPT-4.1 低5倍,成本仅六分之一,酒店测试胜出,值得试试。原文稍后读已读值得跟进有用关注 LiveKit
17:22官方账号Decoder@Jonathan KemperGoogle对其开源模型Gemma 4进行了一次静默更新。更新修复了工具调用中的错误,并解决了回复被截断的问题。新版本在Nvidia Hopper GPU上的运行性能有所提升。此次更新沿用原名,未改变版本号。AI模型Gemma 4GoogleNvidia Hopper10 个信源在谈事件专题推荐理由:Google悄悄修了Gemma 4的bug,工具调用更稳,回复不截断,还在Hopper GPU上跑更快。原文稍后读已读值得跟进有用关注 Gemma 4
06:22官方账号Clement Delangue@ClementDelangue精选Hugging Face 与 Google Gemma 联合举办的 Gemma Challenge 结果出炉。超过100个 AI agent 和人类在6天内协作,将 Gemma 4 推理速度在单张 NVIDIA A10G GPU 上提升5倍,达到491.8 TPS(最快但有质量损失),无损方案达315 TPS。项目展示了多智能体协作优化模型推理的潜力。AI模型Gemma 4Hugging Face推理加速8 个信源在谈事件专题推荐理由:Hugging Face 和 Google 搞了个挑战赛,100多个 AI agent 和人类一起把 Gemma 4 推理速度在单张 A10G 上提升了5倍,最快冲到491.8 TPS,挺酷的。原文稍后读已读值得跟进有用关注 Gemma 4
10:12官方账号arXiv cs.LG@Vladislav BeliaevAgon是一种竞争性跨模型强化学习方法,两个模型互为评分器,无需过程标签或奖励模型。在DeepMath硬数据集中使用Qwen3基准,Agon的pass@1达到GRPO的两倍。该方法通过交替角色训练,使模型逐步面对更强的对手。在Qwen3.5和Gemma 4等模型家族的编程代码任务上也验证了有效性。论文AgonQwen3Gemma 4推荐理由:Agon让两个模型互相打分比赛,推理能力直接翻倍,比GRPO强一倍,而且完全不需要人工标注过程标签。原文稍后读已读值得跟进有用关注 Agon
04:10Paul Couvert@itsPaulAi微调一个免费的开源本地AI模型,在特定任务上可以超越Claude和OpenAI的通用模型。一个针对你数据微调的小语言模型(SLM)性能胜过Anthropic和OpenAI的通用大模型。基座推荐使用Gemma 4或Qwen 3.5/3.6,通过Unsloth Studio进行微调。优势包括:输出不再泛泛、敏感数据不上云、无使用计费、无API费用、无用量限制、可离线运行、系统集成更可靠。技巧fine-tuningGemma 4Qwen 3.510 个信源在谈事件专题推荐理由:别老想着用最大的模型。用Gemma 4或Qwen 3.5免费微调一下,就比Claude还好用,还不用花钱,数据还安全。原文稍后读已读值得跟进有用关注 fine-tuning
14:52Paul Couvert@itsPaulAi精选Paul推荐了5款可在笔记本上运行的本地模型,无需$10k Mac Studio。Qwen3.6-27B被认为是最佳编程智能体模型,Qwen3.6-35B-A3B是更快选项。Gemma 4 12B适合日常问答,Parakeet 0.6B v3是语音转文本最佳模型。Gemma 4 E4B可离线在手机运行,Gemma 4 26B diffusion在本地模型中Token/秒最高。建议使用Unsloth量化版搭配LM Studio或llama.cpp运行。技巧Qwen3.6-27BGemma 4Parakeet1 个信源在谈事件专题推荐理由:Paul整理了5款能塞进笔记本的本地模型,从编程到语音全覆盖,帮你省掉高价工作站的钱。原文稍后读已读值得跟进有用关注 Qwen3.6-27B
01:17官方账号Simon Willison’s Weblog(博客/媒体)精选DeepReinforce 发布 Ornith-1.0,一款 MIT 许可的开源模型,基于 Gemma 4 和 Qwen 3.5 预训练。提供 9B Dense、31B Dense、35B MoE 和 397B MoE 四种规格。在编码基准上达到同尺寸开源模型 SOTA。作者在 LM Studio 上测试 35B Q4_K_M GGUF 版本,能流畅运行代理工具调用并处理代码定位任务。AI模型Ornith-1.0DeepReinforceGemma 42 个信源在谈事件专题推荐理由:DeepReinforce 新出的开源编码模型,基于 Gemma 4 和 Qwen 3.5,在代理编码任务上表现不错,LM Studio 就能跑,值得试试。原文稍后读已读值得跟进有用关注 Ornith-1.0
21:45Thomas Wolf@Thom_Wolf实验让100多个智能体协作一周,优化vLLM中Gemma 4推理速度,最终实现5倍提升。智能体自发拒绝人类社交工程尝试,发现验证漏洞并请求社区裁决。四智能体接力构建int4-lm_head检查点,经诊断配置错误后达到118 TPS(2.68×)。GPU富/贫分工、跨智能体内核调试、配额池化等行为涌现。智能体还指出127 TPS“墙”是假象,并讨论了int4-Marlin floor的循环证明问题。AI模型Gemma 4vLLM多智能体2 个信源在谈事件专题推荐理由:这个实验展示了100多个AI智能体像人类社区一样自发协作、互相监督,甚至发现了验证漏洞。一周将Gemma 4推理速度优化5倍,很酷。原文稍后读已读值得跟进有用关注 Gemma 4
11:41官方账号arXiv cs.AI@Joshua Engels, Callum McDougall, Bilal Chughtai, Janos Kramar, Senthoran Rajamanoharan, Cindy Wu, Arthur Conmy, Asic Q Chen, Jean Tarbouriech, Min Ma, Brendan O'Donoghue, João Gabriel Lopes de Oliveira, Rohin Shah, Neel Nanda71°论文分析 DiffusionGemma 的推理透明度,将其分解为变量透明度和算法透明度。初始发现 DiffusionGemma 的不透明串行深度是自回归 Gemma 4 的 28.6 倍。但通过可解释的 token 瓶颈映射信息流,可将不透明串行深度降至仅 Gemma 4 的 1.1 倍。算法透明度方面,扩散模型因每步所有 token 可变化而更复杂,研究识别了非时间顺序推理、token 与序列涂抹、中间上下文推理等新现象。可监控性测试表明 DiffusionGemma 与 Gemma 4 水平相当。论文DiffusionGemmaGemma 4可解释性3 个信源在谈事件专题推荐理由:Google 团队这篇论文解释 DiffusionGemma 的推理黑箱有多大,发现能用 token 瓶颈把深度压到几乎和 Gemma 4 一样,还发现了扩散模型特有的奇怪推理方式。原文稍后读已读值得跟进有用关注 DiffusionGemma
13:03@atomic_chat_hq@atomic_chat_hq精选Diffusion Gemma 在单个H100(FP8)上速度达763 tok/s,比Gemma 4的218 tok/s快约4倍。但事实准确性测试中,Diffusion Gemma 33个事实正确、28个错误,而Gemma 4为45正确、5错误。话题越冷门错误越多:乔布斯传4错、俄罗斯方块12错、BeOS故事12错。Diffusion Gemma胡编了乔布斯的母亲名字和游戏同事名称,并将BeBox价格虚构为$9,999(实际$1,600)。AI模型Diffusion GemmaGemma 4Google4 个信源在谈事件专题推荐理由:想用更快的推理速度就得接受更多幻觉,Google官方也为此打预防针了。原文稍后读已读值得跟进有用关注 Diffusion Gemma
13:00@atomic_chat_hq@atomic_chat_hq精选Google Gemma 4 12B模型在RTX 4090上实测仅需9GB VRAM,生成8.9k tokens,速度80 tok/s,性能接近26B版本。其对比的Gemma 4 26B-A4B使用15GB VRAM,生成6.9k tokens,速度138 tok/s,所有场景胜出。但12B在近半VRAM下表现十分接近,成为16GB笔记本的理想选择。AI模型Gemma 412B26B-A4B4 个信源在谈事件专题推荐理由:新Gemma 4 12B别看参数小,实测代码能力接近26B版,而且只需要9GB显存,16GB笔记本就能跑。原文稍后读已读值得跟进有用关注 Gemma 4
23:30Philipp Schmid@_philschmid精选Phil Schmid 在推文中引用 Vicki Boykis 的教程,指出 Google 最新 Gemma 4 系列模型能在本地运行 agentic coding 循环,准确率和速度达到前沿模型的约 75%。该教程演示了如何使用本地模型进行编码任务。此前本地模型难以高效完成 agentic 工作流,Gemma 4 将这一差距缩小。技巧Gemma 4Google智能体5 个信源在谈事件专题推荐理由:Vicki Boykis 教你用 Google Gemma 4 在本地跑 agentic coding,速度能到主流模型的 75%,不用联网也能用智能体写代码了。原文稍后读已读值得跟进有用关注 Gemma 4
08:59SuperTechFans(博客/媒体)精选76°作者在 2022 年 M2 Mac(64GB RAM)上测试 Mistral 7B、Gemma 3、OpenAI OSS-20B、Qwen 3 MOE 等多种模型,使用 llama.cpp、Ollama、LM Studio 等工具。她发现自从 GPT-OSS 发布后,本地模型在编程任务上已足够好用,尤其 Google 的 Gemma 4 系列(如 gemma-4-26b-a4b 和 gemma-4-12b-qat)在 Python 代码重构、类型提示修复、写单元测试等 agentic 任务中准确率和速度约为前沿模型的 75%。她分享了本地 agentic 设置:用 Pi 作 agent 框架、LM Studio 作推理服务器,所有操作放在 Docker 容器中以限制权限。本地模型仍有推理速度慢、上下文窗口受硬件限制等问题,但隐私友好、可自由调整参数。技巧M2 MacGemma 4Pi10 个信源在谈事件专题推荐理由:想试本地模型?这篇有 M2 Mac 上跑 Gemma 4 的详细配置,还有 Pi+LM Studio 的 agentic 设置,比云端省心。原文稍后读已读值得跟进有用关注 M2 Mac
20:16官方账号vLLM@vllm_project精选73°vLLM v0.23.0 包含 408 次提交,来自 200 位贡献者(63 位新贡献者)。主要亮点:DeepSeek-V4 在多个后端上成熟,引入 TRTLLM-gen attention 内核、与 V3.2 解耦的稀疏 MLA 以及用于 Mega-MoE 的 EPLB 调度。Model Runner V2 现已成为 Llama 和 Mistral 稠密模型的默认运行器。新增 Gemma 4 Unified(无编码器)及 MTP 支持。还提供了多层级 KV 缓存卸载(含对象存储层)和统一的推理与工具调用解析器。AI产品vLLMDeepSeek-V4Llama4 个信源在谈事件专题推荐理由:vLLM v0.23.0 大更新,DeepSeek-V4 和 Llama 用户值得升级,新的 KV 缓存卸载能省显存,推理与工具调用解析也更顺了。原文稍后读已读值得跟进有用关注 vLLM
09:37官方一手AWS Machine Learning Blog@Aris Tsakpinis精选Google DeepMind 发布的 Gemma 4 开源权重模型系列现已在 Amazon Bedrock 上可用。该系列包含三个指令调优变体:Gemma 4 31B(密集架构)、26B-A4B(MoE 架构,每次激活 4B 参数)和 E2B。所有变体均支持内置推理、原生函数调用以及文本和图像多模态输入。模型基于 Apache 2.0 许可发布,旨在多种部署场景下实现每参数智能最大化。AI模型Gemma 4Amazon BedrockGoogle DeepMind4 个信源在谈事件专题推荐理由:Google DeepMind 把最新的 Gemma 4 放到 AWS 上了,三种规格可选,带推理和图文理解,正好拿来玩开源项目。原文稍后读已读值得跟进有用关注 Gemma 4
11:12官方账号arXiv cs.LG@Ali Asaria, Tony Salomone, Deep Gandhi论文对DiffusionGemma 26B(基于Gemma 4的掩码离散扩散MoE模型)进行解码顺序测量,在686-prompt六场景测试中发现其提交令牌既非并行也非块自回归,而是部分从左到右偏置。偏置强度随分析粒度平滑增强,块大小实为测量伪像而非架构属性。模型以大批量同时提交令牌,批量内顺序多数未定义,行为依赖场景:结构化JSON提交顺序任意,数学推理中位置置信度与正确性相关但事实回忆无信号。提交在预算内晚期爆发,任务准确率与自回归Gemma 4相当。核心贡献是方法论:正确测量需处理尾部EOS填充、场景混淆、提交非单调性、块大小敏感性和大批量平局等混淆因素。论文DiffusionGemmaGemma 4掩码扩散模型5 个信源在谈事件专题推荐理由:解析扩散模型真实解码行为原文稍后读已读值得跟进有用关注 DiffusionGemma
12:04官方账号LMSYS Org (SGLang)@lmsysorg精选SGLang 宣布 Day-0 支持 Google 的 DiffusionGemma 模型,这是 Gemma 4 的文本扩散变体(26B A4B MoE)。与传统逐 token 解码不同,DiffusionGemma 通过并行去噪 token 块实现极低批处理生成速度。该模型支持离散文本扩散、多模态输入(文本、图像、视频)输出文本、稀疏 MoE 架构(8/128 专家)以及可配置思考模式。开发者现在即可通过 SGLang 运行该模型。AI模型SGLangDiffusionGemmaGemma 47 个信源在谈事件专题推荐理由:文本扩散模型大幅提升生成效率,适合需要低延迟批量推理的 AI 应用开发者,建议立即在 SGLang 中体验。原文稍后读已读值得跟进有用关注 SGLang
00:24官方账号SiliconFlowAI@siliconflowai精选Google DeepMind 的 Gemma 4 12B 模型已在 SiliconFlow 平台上线,支持 262K 上下文、内置思考、原生工具调用及 140+ 语言。该模型采用无编码器架构,视觉和音频输入直接进入 LLM 主干,降低处理延迟。12B 参数规模但拥有 26B 的“大脑”性能,接近 Google 26B 模型的表现,在多步推理和智能体工作流中表现出色。定价为输入/输出每百万 tokens 0.1/0.3 美元,性价比突出。AI模型Gemma 4智能体多模态7 个信源在谈事件专题推荐理由:做智能体、长上下文或多模态应用的开发者终于有了一个模型搞定三件事的选择——Gemma 4 12B 在 SiliconFlow 上价格亲民,建议直接上手试试。原文稍后读已读值得跟进有用关注 Gemma 4
06:13Sundar Pichai@sundarpichai78°Google 发布了 DiffusionGemma,这是一个基于 Gemma 4 的实验性开放模型,采用文本扩散技术。与传统逐词预测不同,DiffusionGemma 能同时生成整段文本,实现高达 4 倍的推理加速。该模型目前以研究预览形式开放,旨在探索更高效的文本生成方式。这对于需要低延迟文本生成的场景(如实时对话、内容创作)具有重要意义。AI模型文本扩散推理加速Gemma 47 个信源在谈事件专题推荐理由:推理速度提升 4 倍意味着更低的延迟和更低的成本,做实时文本生成或大规模内容生产的团队值得关注这个新方向。原文稍后读已读值得跟进有用关注 文本扩散
01:49Philipp Schmid@_philschmid78°DiffusionGemma 是基于 Gemma 4 构建的 26B MoE 扩散语言模型,推理时仅激活 3.8B 参数。它采用并行生成 256-token 块的方式,实现了每秒 1000+ tokens 的生成速度。量化后模型可适配 18 GB VRAM,且采用 Apache 2.0 开源协议。这一架构突破了传统自回归模型的生成瓶颈,为高效文本生成提供了新思路。AI模型扩散模型Gemma 4MoE7 个信源在谈事件专题推荐理由:每秒 1000+ tokens 的生成速度让推理成本大幅降低,做大规模文本生成或实时应用的开发者值得关注,量化后 18GB VRAM 就能跑,门槛很低。原文稍后读已读值得跟进有用关注 扩散模型
03:41Patrick Loeber@patloeber在 Google Cloud Summit 捷克站,Pat Loebe 介绍了 Google DeepMind AI 栈,涵盖 Gemini 3.5、GenMedia 与音频模型、AI Studio 等工具、Interactions API 与 Managed Agents 智能体、Gemma 4 以及机器人技术。这展示了 Google 在 AI 领域的全面布局,从模型到工具再到智能体,为开发者和企业提供了完整的解决方案。AI产品Gemini 3.5智能体Google Cloud2 个信源在谈事件专题推荐理由:想了解 Google AI 最新全家桶的开发者,这篇总结帮你快速抓住 Gemini 3.5、智能体 API 和 Gemma 4 的核心亮点,值得收藏。原文稍后读已读值得跟进有用关注 Gemini 3.5
22:52Philipp Schmid@_philschmid精选72°Google 发布了新的 Gemma 4 QAT(量化感知训练)检查点,在保持相似性能的同时,将内存占用降低约 4 倍。该版本引入了一种新的移动端量化格式,将 Gemma 4 E2B 的内存占用降至仅 1GB。QAT 通过在训练过程中模拟低精度运算,实现无损量化,从而得到更小、更快的模型。这些检查点已在 Hugging Face 上提供,可直接运行。AI模型Gemma 4QAT量化1 个信源在谈事件专题推荐理由:做移动端或边缘部署的开发者终于可以跑 Gemma 4 了——内存降到 1GB 意味着手机和 IoT 设备也能用,建议直接去 Hugging Face 拉下来试试。原文稍后读已读值得跟进有用关注 Gemma 4
08:27rohanpaul_ai@rohanpaul_aiAnthropic 表示其 80% 的新生产代码由 Claude 编写,标志着 AI 编程在大型科技公司中的深度应用。Google 新论文显示通用 LLM 通过规划证明和逐步检查,在形式数学任务上从低于 10% 提升至 70% 的准确率。Google 开源 Gemma 4 12B 模型,支持音频和视频分析,可在消费级 16GB GPU 上完全本地运行。阿里巴巴发布 Qwen3.7-Plus,支持文本、视频和图像输入,价格低廉但保持闭源。Anthropic 的化学报告也展示了令人惊讶的结果。行业AnthropicClaudeGoogle10 个信源在谈事件专题推荐理由:AI 编程和数学推理的突破正在改变开发和研究方式,做 AI 应用或数学研究的团队值得关注这些进展,尤其是 Claude 的代码生成和 Gemma 4 的本地部署能力。原文稍后读已读值得跟进有用关注 Anthropic
08:26rohanpaul_ai@rohanpaul_ai精选72°Google 发布了 Gemma 4 的 QAT(量化感知训练)检查点,将最小模型从 11.4GB 压缩至 1.1GB,纯文本版本仅 0.84GB。与传统的 PTQ(训练后量化)不同,QAT 在训练过程中模拟压缩,让模型学会在权重被压缩时保持推理质量。Google 还构建了针对移动端的格式,包括静态激活、通道级量化、目标 2 位量化和 KV 缓存优化,减少手机计算负担,延长长对话的内存使用。这使得 Gemma 4 更容易在手机和笔记本上运行,降低了部署门槛。AI模型Gemma 4量化移动端部署7 个信源在谈事件专题推荐理由:QAT 解决了模型压缩后推理质量下降的痛点,做移动端 AI 部署的开发者可以直接用这些检查点,在手机上跑大模型不再吃内存。原文稍后读已读值得跟进有用关注 Gemma 4
05:45官方账号Google AI@GoogleAIGoogle AI 本周密集发布多项产品更新:Nano Banana 2 和 Nano Banana Pro 正式 GA,可通过 Gemini Enterprise Agent Platform、Gemini API 和 Google AI Studio 使用;Co-Scientist 是一个多智能体系统,用于结构化科学思维,能生成和优化新假设;dreambeans 可基于 Google 应用数据自动生成个性化每日话题;Gemma 4 12B 是统一无编码器模型,支持离线多模态智能;Gemma 4 模型及其 drafters 已通过量化感知训练优化,降低内存需求并提升端侧性能;RealTime 2 是开放权重的实时音乐模型,可通过 MIDI 键盘、文本提示和手势演奏。AI产品智能体多模态模型开源/仓库10 个信源在谈事件专题推荐理由:Google 一周内连发 6 项更新,覆盖企业智能体、科学推理、端侧模型和创意工具,做 AI 应用开发或科学研究的团队值得逐一了解,尤其是 Co-Scientist 和 Gemma 4 12B 的离线能力值得一试。原文稍后读已读值得跟进有用关注 智能体
04:19Paul Couvert@itsPaulAi88°Google 发布了 Gemma 4 QAT 模型,相比前代内存需求降低 3 倍,使得高性能模型能在本地设备上运行。其中 Gemma 4 E4B 模型性能优于 GPT-4o,仅需 2GB RAM 即可在手机上运行。而 Gemma 4 31B 模型(约 Opus 4 级别)现在可以在笔记本电脑上运行。这标志着本地 AI 部署的重大突破,让更多用户无需依赖云端即可使用强大模型。AI模型GoogleGemma 4本地 AI10 个信源在谈事件专题推荐理由:本地 AI 爱好者终于等到了——Gemma 4 QAT 让旗舰级模型跑在手机和笔记本上,做边缘计算或隐私敏感应用的开发者可以直接试试。原文稍后读已读值得跟进有用关注 Google
03:13AI Breakfast@AiBreakfastAI 领域最被低估的趋势是“足够好”的本地智能已经实现。Gemma 4 12B 模型可以在 16GB 内存的笔记本电脑上运行,覆盖普通用户的所有需求。它无限使用、永久免费且完全离线,无需联网或付费。这标志着本地 AI 的实用化里程碑,对隐私敏感或网络受限的用户尤其重要。AI模型Gemma 4本地模型开源/仓库10 个信源在谈事件专题推荐理由:本地 AI 终于不再是玩具——Gemma 4 12B 在普通笔记本上就能跑,日常查询、写作、编程辅助都能搞定,隐私敏感或想省钱的用户可以直接上手试试。原文稍后读已读值得跟进有用关注 Gemma 4