01:19elvis@omarsar0Jacob Peake分享一篇关于AI芯片架构的长篇博客,涵盖NVIDIA、AMD、TPU、Trainium、Cerebras、Groq等主要架构,分析架构、扩展(向上扩展和向外扩展)和软件堆栈,帮助理解架构及其权衡。论文AI芯片架构NVIDIAAMD1 个信源在谈事件专题推荐理由:想要了解AI芯片架构全景的朋友,强烈推荐阅读Jacob Peake的这篇博客,内容详实,对架构和权衡有深入分析。原文稍后读已读值得跟进有用关注 AI芯片架构
08:53IT之家(博客/媒体)71°Anthropic 聘请前谷歌 TPU 项目创始高管阿米尔 · 萨莱克加入算力团队,萨莱克曾负责谷歌 TPU 业务并交付前七代 TPU 芯片。Anthropic 正在打造内部自研芯片业务,以缓解供应链紧缺的压力并匹配自身算法需求。行业Anthropic自研芯片阿米尔 · 萨莱克8 个信源在谈事件专题推荐理由:Anthropic 聘请了前谷歌 TPU 负责人,加强自研芯片能力,与 OpenAI 竞争。原文稍后读已读值得跟进有用关注 Anthropic
22:45IT之家(博客/媒体)美满电子(Marvell)已与谷歌签署定制芯片合作协议,授予谷歌以每股206.58美元行权价购买至多5897万股的认股权证。此次合作涵盖谷歌TPU生态系统关联的AI推理加速器、存储控制器等定制芯片项目。受此消息影响,Marvell在8月19日盘前交易中股价涨超10%。认股权证涉及58,970,907股Marvell普通股,部分将在第一年内归属,剩余部分将根据谷歌采购额分批归属至2033年。行业Marvell谷歌TPU推荐理由:Marvell和谷歌签了芯片大单,谷歌能以206.58美元买近5900万股,股价盘前就涨了10%以上。原文稍后读已读值得跟进有用关注 Marvell
05:12官方账号Decoder@Matthias Bastian前DeepMind CEO Demis Hassabis已退出日常管理约一年,自称更愿做科学家而非管理者。研究人员抱怨难以获得Google自研TPU芯片的访问权限,而Anthropic等外部客户可通过Google Cloud购买相同硬件。人才流失或与芯片短缺、利益冲突及Google内部官僚体系有关。行业DeepMindGoogleTPU10 个信源在谈事件专题推荐理由:这篇分析把DeepMind人才流失的原因说透了:不是待遇,是芯片不够用、自家优势外流和Google流程拖后腿。原文稍后读已读值得跟进有用关注 DeepMind
09:11官方账号Jeff Dean@JeffDean精选谷歌首席科学家Jeff Dean在YC Startup School 2026上回忆与Sanjay Ghemawat在2001年发现整个搜索索引可放入RAM,随即几天内实现快速搜索。2013年,他通过计算用户每天三分钟语音识别所需算力,发现需翻倍服务器数量,由此激发TPU的诞生。访谈还讨论了AI代理可运行数周、上下文工程成为前沿、以及为什么AI本质是能源问题。Dean强调两个人在一个房间里仍能击败大公司,并分享了成为AI原生创始人的路径。行业Jeff DeanGoogleTPU1 个信源在谈事件专题推荐理由:Jeff Dean讲了Google当年靠餐巾纸算出了TPU和搜索加速的故事,还给出了初创公司能从哪些角度赢Google,挺有启发。原文稍后读已读值得跟进有用关注 Jeff Dean
05:50Y Combinator@ycombinator82°在 Startup School 2026 上,Google 首席科学家 Jeff Dean 回顾了 2001 年他和 Sanjay Ghemawat 将整个 Google 搜索索引装入 RAM 的决策,使搜索速度大幅提升。他还提到 2013 年一张餐巾纸上的计算显示,每天每人三分钟语音识别需要 Google 双倍服务器,这催生了 TPU。访谈讨论 AI 模型是否已是初级工程师、AI Agent 可运行数周、推理硬件将成为下一个专业化方向,以及两三人团队如何依然能击败 Google。行业GoogleTPUJeff Dean1 个信源在谈事件专题推荐理由:看看 Google 首席科学家 Jeff Dean 亲自讲 TPU 是怎么从一张餐巾纸上的数学计算变成现实的,还有他给 AI 创业者的灵感——小团队依然能赢。原文稍后读已读值得跟进有用关注 Google
11:00elvis@omarsar0精选Google、哈佛、UC Berkeley联合发布JAXBench,包含50个JAX工作负载,基于Llama-3.1、DeepSeek-V3、Mixtral、Mamba-2、AlphaFold2等真实架构。通过Gemini 3 Flash结合TPU文档优化,正确率从5.8%提升到37.3%,解决48个基准,速度提升1.28倍。束搜索进一步提速至1.36倍。研究表明正确率是文档问题,速度是搜索问题。论文JAXBenchGemini 3 FlashTPU推荐理由:Google的新研究发现,给模型喂对TPU文档,比堆参数管用。JAXBench测50个真实负载,结果很实在。原文稍后读已读值得跟进有用关注 JAXBench
10:48官方账号Logan Kilpatrick@OfficialLoganK精选LoganK在推文中感谢Tibo,并提及TPU和预训练团队正在积极研发。目前没有公布具体模型名称或基准数据。团队专注于TPU基础设施与预训练流程的优化。行业TPU预训练团队10 个信源在谈事件专题推荐理由:如果你关注AI基础设施和预训练进展,这条信息告诉你某个团队正在努力,具体成果可以期待后续。原文稍后读已读值得跟进有用关注 TPU
10:59岚叔@lufzzliz83°据内部报道,Google正在开发一款名为Frozen v2的专用芯片,专为Gemini模型推理设计。该芯片通过将部分模型架构和计算流程固化到硅片中,减少运行时判断和数据搬运,权重可更换。内部估计其单位功耗下的Token生成数量可达最新自研AI芯片的6-10倍。Frozen v2不替代TPU,预计2028年上线。背景是Google算力紧张,SEC文件显示其与SpaceX签署了约11万张Nvidia GPU的合同,月费约9.2亿美元。AI产品GeminiFrozen v2Google8 个信源在谈事件专题推荐理由:Google为Gemini专门做了芯片Frozen v2,能效是TPU的6-10倍,2028年上线。把部分计算固化到硅片,思路挺实用。原文稍后读已读值得跟进有用关注 Gemini
02:15官方账号Decoder@Matthias Bastian精选Google正在开发代号为Frozen v2的服务器芯片,直接将Gemini模型架构固化到硅片中。内部消息称,其推理效率比现有TPU高6至10倍。该芯片计划于2028年推出,旨在大幅降低AI推理成本,使Google在定价上获得相对于OpenAI和Anthropic的优势。AI产品GoogleGeminiFrozen v210 个信源在谈事件专题推荐理由:Google搞了个叫Frozen v2的芯片,直接把Gemini架构做到硬件里,效率比TPU快6到10倍,预计2028年上线,成本优势可能让它在和OpenAI、Anthropic的竞争中更便宜。原文稍后读已读值得跟进有用关注 Google
22:12IT之家(博客/媒体)谷歌正在研发代号 Frozen v2 的专用芯片,将 Gemini 模型底层架构固化到硬件中,单位功耗处理词元数可达现有自研 AI 芯片的 6 至 10 倍。该芯片最早计划于 2028 年部署,保留通过更新权重进行迭代的能力。Frozen v2 将与谷歌现有的 TPU 形成互补关系,而非替代。谷歌已与 Meta 签署数十亿美元 TPU 租用订单,并积极拓展云客户。行业GoogleFrozen v2Gemini推荐理由:谷歌搞了个 Frozen v2,专为 Gemini 模型定制,效率比现有芯片高 6 到 10 倍,还能更新权重。AI 芯片方向的新探索,值得关注。原文稍后读已读值得跟进有用关注 Google
15:54IT之家(博客/媒体)谷歌正向 Neocloud 推销其自有 TPU AI 芯片。Neocloud 企业通常主要基于英伟达 GPU 提供云算力。谷歌与多家 Neocloud 企业讨论部署 TPU,并提议回租 TPU 云服务。Nscale 发言人表示其所有签约集群均由 GPU 支持,英伟达未因不使用 TPU 提供财务激励。行业GoogleTPUNeocloud4 个信源在谈事件专题推荐理由:谷歌想用自家TPU抢英伟达的Neocloud客户,还提议回租。看看Neocloud会选谁。原文稍后读已读值得跟进有用关注 Google
20:45IT之家(博客/媒体)精选73°谷歌2025年环境报告显示,因快速扩展AI基础设施,公司用电量同比增长37%,创历史新高。但通过提升能源效率和扩大可再生能源使用,运营碳排放同比下降2%。谷歌数据中心能源利用效率约为行业平均水平的1.83倍,2025年新增签署超12GW可再生能源采购协议,累计签订超240份绿电合同、总装机约35GW。公司称凭借优化方案,2025年避免约5800万吨二氧化碳排放,且连续九年实现100%可再生能源电力匹配。行业谷歌AI基础设施可再生能源推荐理由:谷歌用电飙涨37%但碳排放反降2%,靠能效和绿电做到了‘脱钩’,还帮用户省了4100万吨碳,数据很扎实。原文稍后读已读值得跟进有用关注 谷歌
22:54IT之家(博客/媒体)精选中昊芯英发布新一代全自研TPU芯片「须臾」,单芯片混合精度浮点算力达896TFLOPS,是上一代芯片「刹那」的3倍。8-bit推理算力达1792TOPS,适配高并发推理场景。单卡额定功耗600W,比传统算力芯片降低50%,支持超长上下文。同步推出智算平台「泰则2.0」,搭载两路CPU与8片TPU,算力达7.168P混合精度,整机能耗仅为传统GPU服务器的80%。平台兼容PyTorch、vLLM、DeepSpeed等主流框架,已完成Qwen、DeepSeek等数十款大模型适配。AI产品中昊芯英须臾TPU推荐理由:中昊芯英发了新TPU芯片「须臾」,算力是上一代3倍,功耗反而降一半,全自研无依赖,适合政务金融等安全场景。原文稍后读已读值得跟进有用关注 中昊芯英
14:15IT之家(博客/媒体)哈萨比斯在戛纳创意节受访,回应谷歌AI人才流失质疑。他以Noam Shazeer(《Attention is All You Need》作者之一)为例,指出顶级研究员身价堪比明星运动员。哈萨比斯强调谷歌拥有庞大数据生态、整合硬件体系和大规模TPU集群,是训练下一代前沿模型的核心优势。2023年Google Brain与DeepMind合并后,统一架构进一步集中AI资源。行业DeepMind谷歌TPU推荐理由:哈萨比斯亲自讲谷歌怎么留人:有TPU集群、海量数据,还有2023年合并后的统一架构,不是光画饼。原文稍后读已读值得跟进有用关注 DeepMind
03:46官方账号Jeff Dean@JeffDean73°Jeff Dean宣布一篇将发表于IEEE Micro 2026年7/8月刊的论文,详细回顾Google从TPU v2到Ironwood共五代训练超算的架构演变。论文披露TPU每芯片每瓦TFLOPS提升了约30倍,每个pod的芯片数从TPU v2的256颗扩增至Ironwood的9216颗。冷却方式从风冷(TPU v2)转为水冷(TPU v3起),互连从2D torus升级为3D torus。论文还指出工作负载已大幅转向Transformer模型。论文TPUGoogleIronwood1 个信源在谈事件专题推荐理由:想看TPU五代真实进化数据和能效提升细节?这篇论文从256芯片到9216芯片、从风冷到水冷、30倍每瓦算力提升,全是硬货。原文稍后读已读值得跟进有用关注 TPU
04:27官方账号LMSYS Org (SGLang)@lmsysorg精选73°LMSYS 发表博客详解如何用 SGLang-JAX 在 TPU v7x 上优化 Ling-2.6-1T(1T 参数混合 MoE 模型)。通过 Fused MoE V2 内核将令牌和累加器留在 VMEM 中并双缓冲专家权重,MoE 预填充延迟降低 53%。混合内存池为 10 个全注意力层分配逐令牌 MLA KV,为 70 个 GLA 层分配逐请求循环状态。GLA 线性注意力采用分块并行预填充,单控制器 DP 保持分组 RMS Norm 芯片本地化,无需逐层跨芯片规约。AI模型Ling-2.6-1TTPUSGLang-JAX推荐理由:LMSYS 和 InclusionAI 联手,用 SGLang-JAX 让 1T 参数 MoE 在 TPU 上跑得快 53%,技术细节都在博客里。原文稍后读已读值得跟进有用关注 Ling-2.6-1T
07:35IT之家(博客/媒体)据科技媒体 The Information 报道,谷歌正与三星晶圆代工部门洽谈,计划由三星 2nm 工艺代工其下一代 TPU v10 芯片的 I/O Die 部分。谷歌 TPU 与博通联合设计,计算引擎仍由台积电生产,而内存输入输出芯片可能转交三星。此前三星已为谷歌第七代 Ironwood TPU 提供超 60% 的 HBM 内存。若合作达成,谷歌可进一步降低 TPU 成本——其当前性能与英伟达 H100 相当,但成本已低约 80%。此举可能重塑 AI 半导体供应链格局,减少对单一代工厂的依赖。行业谷歌三星TPU推荐理由:谷歌 TPU 成本优势已让英伟达紧张,若三星 2nm 代工落地,AI 芯片供应链将更分散——做 AI 基础设施的团队值得关注这一变局。原文稍后读已读值得跟进有用关注 谷歌
22:50rohanpaul_ai@rohanpaul_ai据 The Information 报道,Google 已选择 Intel 为其制造超过 300 万颗 TPU 芯片,计划于 2028 年交付。这对 Intel 的晶圆代工业务是一次重大胜利,使其成为 NVIDIA 主要 AI 竞争对手的工厂。由于 AI 热潮导致芯片需求激增,台积电产能紧张,多家 AI 芯片设计公司转向 Intel 作为第二供应商,以降低供应链风险。此举对 Google、NVIDIA、Apple、Tesla 等公司而言,意味着供应链多元化的重要进展。行业GoogleIntelTPU5 个信源在谈事件专题推荐理由:AI 芯片供应链正在重构,做 AI 基础设施或依赖 GPU/TPU 的团队值得关注——Intel 代工崛起可能改变未来芯片成本和供应格局。原文稍后读已读值得跟进有用关注 Google
11:15IT之家(博客/媒体)科技媒体 Wccftech 报道,Marvell(美满电子)近期获得谷歌 TPU 定制网络芯片设计订单,该芯片用于连接多个 ASIC 构建同步计算集群,协调数据流与处理拥塞。由于台积电先进节点产能紧张,该芯片可能采用英特尔 18A 或 18AP 制程,预计 2027 年底量产。此前英伟达 CEO 黄仁勋曾预言 Marvell 将成为下一个万亿美元公司,消息后其股价大涨 25%。这一订单标志着 Marvell 在 AI 数据中心网络芯片领域的重要突破,也反映了谷歌对定制化 AI 基础设施的持续投入。行业Marvell谷歌TPU推荐理由:AI 数据中心网络芯片需求激增,做 AI 基础设施或芯片设计的团队值得关注 Marvell 的布局——黄仁勋的预言和谷歌的订单都是信号。原文稍后读已读值得跟进有用关注 Marvell
00:10小互@imxiaohu精选Midjourney创始人公开表示,团队因采用Google TPU进行训练,研究进度相比使用Nvidia GPU技术栈落后约一年。他称如果回到过去,会从一开始就全部使用Nvidia的方案。这一言论反映了大模型训练中硬件生态适配的隐蔽成本。行业MidjourneyGoogleTPU2 个信源在谈事件专题推荐理由:创始人亲述选错硬件的代价原文稍后读已读值得跟进有用关注 Midjourney
10:45IT之家(博客/媒体)精选72°谷歌与全球最大私募股权集团黑石合作,计划在美国成立一家新的AI云公司,初期黑石投入50亿美元股权资本,整体计算投资规模预计约250亿美元。新公司将依托谷歌自研TPU芯片和云能力,挑战CoreWeave等AI算力服务商,被视为谷歌最大规模的对外芯片商业化尝试。目标是在2027年上线500兆瓦容量,相当于一座中等城市的用电需求。此举将加剧谷歌与英伟达在AI算力市场的竞争,黑石作为AI基础设施领域最活跃的投资方之一,已拥有超过1500亿美元数据中心资产。行业谷歌黑石AI云推荐理由:谷歌终于把TPU推向外部市场,做AI训练和推理的团队将多一个算力选择,值得关注这个250亿美元级别的云服务新玩家。原文稍后读已读值得跟进有用关注 谷歌
13:37官方账号Jeff Dean@JeffDeanGoogle 首席科学家 Jeff Dean 在 Cloud Next 上与 Amin Vahdat 及 AcquiredFM 主持人讨论了新发布的 TPU v8t 和 v8i 芯片。这些芯片专为 AI 训练和推理优化,性能大幅提升。Jeff Dean 在推文中分享了个人兴奋点,并附上博客文章链接。该发布标志着 Google 在 AI 硬件领域的持续投入,对云服务和 AI 开发者意义重大。AI产品TPUGoogleAI 硬件推荐理由:Google 新一代 TPU 发布,AI 训练和推理性能再升级,做大规模模型训练或云服务的团队值得关注,看看 Jeff Dean 最兴奋的点是什么。原文稍后读已读值得跟进有用关注 TPU
13:37官方账号Jeff Dean@JeffDean精选Google Translate 迎来20周年,Jeff Dean 回顾了其关键里程碑:2006年首次部署基于5-gram语言模型的系统,使用了万亿词级训练数据,是早期大语言模型实践;2016年转向深度神经网络,结合序列到序列模型和自研TPU,推理性能提升30-80倍,延迟降低15-30倍,使服务可覆盖数亿用户;近期又借助Gemini模型进一步优化。这些技术迭代持续提升了翻译质量和全球连接性。AI产品Google Translate机器翻译大语言模型推荐理由:Jeff Dean 亲自梳理了 Google Translate 从统计方法到神经网络的两次关键跃迁,做 NLP/翻译系统的开发者能从中看到技术选型的真实演进逻辑,值得一读。原文稍后读已读值得跟进有用关注 Google Translate
00:33官方一手Google Developers Blog(博客/媒体)TorchTPU是Google为TPU打造的原生PyTorch运行栈,旨在最小代码改动下实现高性能分布式训练。它采用“Eager First”模式,并利用XLA编译器优化集群训练。项目计划在2026年进一步降低编译开销,支持动态形状和自定义内核,以支持下一代AI模型的扩展。AI产品TPUPyTorchXLA编译器推荐理由:TorchTPU让PyTorch用户能够更顺畅地迁移到TPU,同时保持Eager模式体验,这对需要TPU算力的大规模AI训练场景有直接价值。原文稍后读已读值得跟进有用关注 TPU
00:33官方一手Google Developers Blog(博客/媒体)Google的MaxText框架现在支持在单主机TPU上进行监督微调(SFT)和强化学习(RL),利用JAX和Tunix库实现高效模型优化。开发者可通过GRPO和GSPO等算法轻松调整预训练模型以适应专业任务和复杂推理。该更新简化了从单主机到多主机配置的微调流程,为后训练工作流提供了可扩展路径。AI产品微调/RLTPUJAX推荐理由:这表明Google正在降低TPU上高级模型微调的门槛,让中小规模团队也能在单主机TPU上应用RL算法进行后训练,对AI开发实践有实用价值。原文稍后读已读值得跟进有用关注 微调/RL
00:33官方一手Google Developers Blog(博客/媒体)加州大学圣地亚哥分校研究者将DFlash(一种块扩散推测解码方法)成功部署到Google TPU上,通过单次前向传播“绘制”整个候选词块,绕过传统自回归逐步预测的顺序瓶颈。该系统在TPU上实现了平均3.13倍的加速,峰值性能接近现有EAGLE-3方法的两倍。该开源方案已集成至vLLM生态,利用TPU的免费并行验证和高品质草稿预测,显著提升复杂推理任务的效率。AI模型推理加速推测解码TPU推荐理由:这一工作展示了扩散式推测解码在TPU上的实际落地价值,突破传统推测解码的顺序瓶颈,尤其利好大规模LLM推理场景。开源集成至vLLM有助于行业快速采用。原文稍后读已读值得跟进有用关注 推理加速