09:52SuperTechFans(博客/媒体)AMD 收购 AI 芯片初创公司 Taalas,其技术将模型权重直接蚀刻进硅片,形成模型专用集成电路。首款测试芯片 HC1 在台积电 6nm 工艺上运行 Llama 3.1 8B,每秒生成 16960 token,比 Nvidia GPU 快 48 倍。第二代 HC2 支持 200 亿参数,50 个加速器可支撑万亿参数模型。该技术模型一旦刻入无法更改,重大更新需重新流片,仅更换两层金属层即可。收购预计于第四季度完成。行业AMDTaalas推理芯片3 个信源在谈事件专题推荐理由:AMD 收了家芯片公司,把 Llama 模型刻进硅片跑推理,比 Nvidia GPU 快 48 倍,就是模型固定不能升级。原文稍后读已读值得跟进有用关注 AMD
02:16官方账号Decoder@Matthias BastianAMD收购了加拿大初创公司Taalas,后者将模型权重硬编码进推理芯片,以此换取极致速度。其演示芯片运行Llama 3.1-8B时,每用户每秒可处理超过1.6万个token。这种方案让芯片性能极高,但每颗芯片只能运行单一模型,无法灵活切换。据报道,谷歌也在为Gemini探索类似的芯片内固化方案。行业AMDTaalasLlama 3.1-8B推荐理由:AMD买了家叫Taalas的初创,把模型权重直接烧进芯片,跑Llama 3.1-8B能到每用户每秒1.6万token,但一颗芯片只认一个模型。原文稍后读已读值得跟进有用关注 AMD
12:25Amjad Masad@amasad82°Etched 宣布完成 3 亿美元 C 轮融资,估值达 103 亿美元,投资方包括 Sequoia、Andreessen Horowitz、Jane Street、Argo 和 SK Hynix。公司计划加速推理集群生产,并在办公室附近新建一个 80,000 平方英尺、10 MW 的设施。此次融资将用于扩大产能和原型开发。行业EtchedSequoiaAndreessen Horowitz2 个信源在谈事件专题推荐理由:Etched 拿到 3 亿美元,估值飙到 103 亿,老牌风投 Sequoia、a16z 都跟了。它们专做推理芯片,还建了个 8 万平方英尺的工厂。原文稍后读已读值得跟进有用关注 Etched
09:18IT之家(博客/媒体)精选初创公司 Acrab 推出首款边缘 AI SoC GΞLIX 1,基于 5nm 制程,AI 算力达 650TOPS。芯片采用异构设计,包含 20 核 Arm CPU、3TFLOPS GPU 和 NPU,支持 100B 参数模型本地推理。在 Gemma 26B A4B 配置下,预填充速率达 1416.8 Token/s,是苹果 M4 Pro Mac Mini 的 7.5 倍。Acrab 同步提供软件堆栈和基于该芯片的 Agent Box 终端设备。AI模型GΞLIX 1Acrab边缘AI推荐理由:Acrab 新出的 GΞLIX 1 芯片能直接在边缘设备跑 100B 模型,算力 650TOPS,预填充比 M4 Pro 快 7.5 倍,还有配套 Agent Box,适合本地 AI 部署。原文稍后读已读值得跟进有用关注 GΞLIX 1
11:24IT之家(博客/媒体)百度昆仑芯科技在 2026 世界人工智能大会上首次展出第四代 AI 芯片 M100 实物,该芯片延续自研 XPU 架构,针对大模型推理场景进行优化,主打通用、高效和经济。昆仑芯同时展示了 32/64 卡超节点及 256 卡超节点集群,后者是国内率先量产交付的超节点产品之一。M100 于 2025 年 11 月发布,定位“极致性价比”,而 M300 则面向超大规模多模态模型训练和推理。AI产品昆仑芯 M100百度昆仑芯推荐理由:百度自研的昆仑芯 M100 真机亮相了,专为大模型推理设计,性价比打得很极致,还有 256 卡超节点集群已经量产,AI 算力选择又多了一个。原文稍后读已读值得跟进有用关注 昆仑芯 M100
20:03techcrunch@Tim Fernholz一笔4亿美元的芯片支持贷款显示,早期GPU融资方开始转向推理芯片。该交易由一家未具名金融机构提供,用于购买专用推理芯片而非传统GPU。此举标志着AI基础设施从训练向推理阶段的重心转移,反映了市场需求的变化。分析认为,推理芯片在能效和成本上更具优势,可能重塑未来AI硬件投资格局。行业GPU推理芯片AI基础设施推荐理由:GPU融资方开始押注推理芯片,4亿美元大单说明风向变了,干AI基础设施的得留意。原文稍后读已读值得跟进有用关注 GPU
16:08官方一手pandaily@contact@pandaily.com (Pandaily)DeepSeek与智谱AI宣布自研AI推理芯片,效仿OpenAI和Anthropic。此举旨在降低对英伟达GPU的依赖,并削减推理成本。国内头部AI实验室开始从模型层面向上游芯片延伸,标志行业结构转型。行业DeepSeek智谱AI自研芯片10 个信源在谈事件专题推荐理由:DeepSeek和智谱也开始自己造芯片了,目标就是省钱和摆脱对英伟达的依赖。原文稍后读已读值得跟进有用关注 DeepSeek
15:37IT之家(博客/媒体)72°SambaNova在F轮融资中以110亿美元估值获得10亿美元(约68.02亿元人民币)。该企业与摩根大通达成了交易,后者将部署其RDU芯片用于内部AI工作负载。SambaNova的AI芯片配备大容量SRAM和HBM内存,特别适合AI推理中的解码负载。行业SambaNova摩根大通RDU推荐理由:SambaNova刚拿了10亿美金,还拿下摩根大通这个大客户,推理芯片设计挺特别的。原文稍后读已读值得跟进有用关注 SambaNova
14:10量子位@梦晨DeepSeek于一年前启动秘密造芯项目,专攻AI推理芯片。目前已与多家芯片设计公司、晶圆代工厂和存储器供应商展开接洽。招聘全程不公开,显示该项目高度保密。此举可能降低对第三方芯片的依赖,提升推理效率。行业DeepSeekAI芯片推理芯片推荐理由:DeepSeek偷偷造芯片了,专为推理优化,已经找好代工厂和存储器供应商,硬件布局动了真格。原文稍后读已读值得跟进有用关注 DeepSeek
03:19@koltregaskes@koltregaskes精选71°DeepSeek 正在自研专用于推理的 AI 芯片,该项目已进行约一年。公司已私下招募芯片设计师,并与合作伙伴沟通,同时仍在使用 Nvidia 和华为的芯片来运行 R1 等模型。美国对先进芯片的出口管制是推动包括 DeepSeek 在内的多家实验室自研芯片的直接原因。不过芯片研发周期长达数年,且会面临与其他厂商相同的制造瓶颈。行业DeepSeekAI芯片推理芯片8 个信源在谈事件专题推荐理由:DeepSeek 自己动手做推理芯片了,不想被英伟达卡脖子,但这条路得走好几年。原文稍后读已读值得跟进有用关注 DeepSeek
00:29@koltregaskes@koltregaskesAnthropic已启动自研AI芯片的早期工作,并与三星洽谈制造。此举紧随OpenAI在九个月内与博通合作推出推理芯片之后。自研芯片能让实验室更严格控制推理成本,并根据自身模型架构定制,而非依赖英伟达的通用硬件。对创作者而言,未来可能带来更便宜或更快的输出生成,但初期效益可能仅限于实验室内部服务。行业Anthropic三星AI芯片10 个信源在谈事件专题推荐理由:Anthropic也开始搞芯片了,正在和三星谈代工。跟OpenAI自己造推理芯片一个道理,以后可能加速推理、降低成本,不跟英伟达玩了。原文稍后读已读值得跟进有用关注 Anthropic
09:36Scott Wu@ScottWu4673°Etched公司结束隐身模式,宣布完成A0流片并筹集8亿美元资金,已获得超过10亿美元客户合同。早期客户测试显示,其芯片在推理工作负载上实现SOTA吞吐量、延迟和能效。首批发货的机柜计划于今年夏季交付。推文同时指出推理计算需求将呈指数级增长。AI产品Etched推理芯片SOTA5 个信源在谈事件专题推荐理由:Etched拿了8亿美元和10亿合同,做出推理芯片,性能SOTA,今夏就能买到,值得关注原文稍后读已读值得跟进有用关注 Etched
09:24IT之家(博客/媒体)AI芯片初创企业Etched宣布其推理加速器芯片完成A0步进流片,并已获得超10亿美元订单和8亿美元B轮融资,首批机架预计2026年夏天出货。该芯片基于台积电N4P制程,数学模块电压比大多数竞品低50%以上,能以超80%算力效率运行1T规模的稀疏MoE模型。缓存侧采用片内SRAM+片外HBM组合,兼顾低延迟和大容量,实现高吞吐与交互性。AI模型EtchedSRAMHBM5 个信源在谈事件专题推荐理由:Etched发了款新推理芯片,电压比竞品低一半,跑1T模型还能保持80%效率,还用了SRAM加HBM缓存,挺有意思。原文稍后读已读值得跟进有用关注 Etched
04:06官方账号Tri Dao (FlashAttention)@tri_dao精选Etched公司仅用2年就完成了芯片设计和出货。该芯片将注意力机制硬编码到硅片中,实现了极高的模型利用率(MFU)。这种为LLM推理定制的硬件有望将智能成本降低10倍。AI产品Etched推理芯片LLM推理3 个信源在谈事件专题推荐理由:Etched把注意力写进芯片里,2年搞定,LLM推理成本要降10倍了。原文稍后读已读值得跟进有用关注 Etched
00:50berryxia@berryxia83°OpenAI推出自研AI芯片Jalapeño,专用于推理(Inference)场景,设计制造仅用9个月,并由AI辅助完成。该芯片由Broadcom负责生产,目标是将推理成本降低约50%(Broadcom CEO原话)。早期性能数据显示,其性能功耗比显著优于NVIDIA Blackwell和Google TPU。首批样片已到手并开始测试。AI产品OpenAIJalapeñoBroadcom10 个信源在谈事件专题推荐理由:OpenAI被推理成本逼急了,自研芯片Jalapeño,9个月流片,性能超Blackwell和TPU还省一半钱,值得看看细节。原文稍后读已读值得跟进有用关注 OpenAI
22:18shao__meng@shao__meng89°OpenAI 联合 Broadcom 和 Celestica 从零设计并成功流片了首款自研 LLM 推理加速器 Jalapeño,耗时 9 个月,宣称能效显著优于当前 SOTA。该芯片专为 ChatGPT、Codex 和 API 等工作负载优化,计划从 2026 年底起以吉瓦级规模部署。此举是 OpenAI 垂直整合战略的一部分,与 Google TPU、Amazon Trainium 等路径一致,旨在通过自研芯片提升推理效率、降低成本和改善用户体验。AI模型JalapeñoOpenAIBroadcom10 个信源在谈事件专题推荐理由:OpenAI 和 Broadcom 联手搞了颗推理芯片 Jalapeño,9 个月就流片了,能效比现在最好的还强,计划 2026 年底大规模部署,想自己掌控底层硬件。原文稍后读已读值得跟进有用关注 Jalapeño
22:14官方账号Decoder@Maximilian Schreiner86°OpenAI与Broadcom联合推出了名为Jalapeño的定制芯片。该芯片专为大语言模型推理场景优化。计划于2026年底实现大规模部署。AI产品OpenAIBroadcomJalapeño10 个信源在谈事件专题推荐理由:OpenAI和Broadcom联手搞了一款叫Jalapeño的推理芯片,2026年底就能用上,跑大模型可能更快更省钱了。原文稍后读已读值得跟进有用关注 OpenAI
21:21IT之家(博客/媒体)83°OpenAI与博通联合设计的定制AI推理芯片Jalapeño首次公开,性能声称可与英伟达Blackwell和谷歌TPU媲美。该芯片专为大语言模型优化,已完成与GPT-5.3-Codex-Spark模型的测试,功耗和性能达标。芯片由台积电制造,设计周期仅9个月,计划2024年底前内部部署,不对外销售。配套服务器由天弘科技生产,内存由SK海力士和三星供应。AI产品JalapeñoOpenAI博通10 个信源在谈事件专题推荐理由:OpenAI和博通搞定了自己的推理芯片Jalapeño,性能对标英伟达Blackwell,年底就用上,未来还有多代迭代。原文稍后读已读值得跟进有用关注 Jalapeño
21:15官方一手OpenAI Blog(博客/媒体)76°OpenAI和Broadcom联合推出Jalapeño芯片,这是一款专为LLM推理设计的定制AI芯片。该芯片旨在提升AI系统的性能、效率和可扩展性。它针对大规模AI部署进行了优化。AI产品OpenAIBroadcomJalapeño10 个信源在谈事件专题推荐理由:OpenAI和博通合作出了Jalapeño芯片,专为LLM推理优化,性能效率和扩展性都提升了,适合大规模AI系统。原文稍后读已读值得跟进有用关注 OpenAI
14:09IT之家(博客/媒体)郭明錤透露,谷歌在 TPU v9(Humufish)基础上推出升级改款 Triggerfish,针对 AI 推理优化,由联发科独家代工。Triggerfish 片内 SRAM 缓存规模为 Humufish 的 2~3 倍,可降低数据传输开销;片外 DRAM 从 HBM4 升级至 HBM4E。该芯片旨在缓解“CPU 墙”与“内存墙”问题,预计2027年底投产,2028年底放量,生命周期出货 100~200 万颗,单价较 Humufish 高出约三成。还引入“simulation die”,可能用于本地 TPU 管理、训推切换等功能。AI模型谷歌TPU v9联发科推荐理由:谷歌和联发科联手要做 TPU v9 推理升级版 Triggerfish,缓存翻倍、内存升级,2027 年就能看到成品了。原文稍后读已读值得跟进有用关注 谷歌
23:12IT之家(博客/媒体)字节跳动正与天数智芯洽谈采购至少5万颗智铠系列云端推理GPU,用于旗下AI聊天机器人“豆包”等产品的推理运算。若交易达成,天数智芯将成为字节跳动继华为和寒武纪之后的第三家国内GPU供应商。行业预测2026年字节预计投入1500亿元用于全球算力采购,其中国产算力约400亿元以上。据研究,推理能耗已占AI总能耗约60%至90%,中国推理需求达到训练需求的8倍。行业天数智芯字节跳动豆包推荐理由:字节正在买天数智芯的推理芯片给豆包用,国产算力玩家越来越热闹,建议关注。原文稍后读已读值得跟进有用关注 天数智芯
10:37IT之家(博客/媒体)71°Tensordyne 发布 Napier 推理系统,宣称能效是 NVIDIA Blackwell 系统的 17 倍,吞吐量达 13 倍。Napier 采用对数数学设计简化乘法运算,由台积电 3nm 制程生产。TDN72 集成 72 颗芯片,机柜级系统可支持 1000 Token/s/user 的 LLM 推理。AI产品TensordyneNapierBlackwell4 个信源在谈事件专题推荐理由:Tensordyne 搞了个叫 Napier 的推理芯片,用对数数学省掉了乘法,据说比 NVIDIA Blackwell 快 13 倍,能耗还低 17 倍。初创敢叫板老黄,看看值不值。原文稍后读已读值得跟进有用关注 Tensordyne
03:05rohanpaul_ai@rohanpaul_ai76°据 The Information 报道,Anthropic 正在与微软进行早期谈判,计划租赁并使用微软自研的 Maia 200 AI 芯片用于推理任务。微软宣称 Maia 200 在某些推理场景下比英伟达芯片更具成本效益。该芯片是微软第二代 AI 加速器,采用台积电 3nm 工艺,配备 216GB HBM3e 显存和 7TB/s 带宽,专为快速处理大模型推理而设计。Anthropic 已承诺向 Azure 投入 300 亿美元,微软可能向 Anthropic 投资 50 亿美元,且 Claude 已深度集成到微软 Copilot 中,因此芯片合作是双方客户-供应商反馈循环的一部分。分析认为,Maia 无需在所有领域击败英伟达,只要在特定高容量推理任务中更便宜,就能将数十亿 token 从 GPU 转移过来。AI产品Anthropic微软Maia 20010 个信源在谈事件专题推荐理由:微软 Maia 芯片若在推理成本上优于英伟达,做大规模 AI 推理的团队将多一个省钱选择,Anthropic 的动向值得关注。原文稍后读已读值得跟进有用关注 Anthropic