09:18IT之家(博客/媒体)创见资讯推出面向工业应用的全系列 7200MT/s 传输速率 DDR5 内存模组。该产品支持 -20℃ ~ +85℃ 的工业级宽温工作范围。ECC 与 RDIMM 版本采用 30 μin 镀金“金手指”及抗硫化技术,可提升接点耐用性。其适用范围覆盖 PC、嵌入式、工作站、服务器与数据中心,可满足 AI 推理、工业自动化等需求。行业TranscendDDR5工业内存推荐理由:创见出了款能扛住 -20℃ 到 +85℃ 的 DDR5 内存,还用了抗硫化技术,适合工业设备用,比普通内存更耐用。原文稍后读已读值得跟进有用关注 Transcend
10:15IT之家(博客/媒体)联想集团发布2026财年第一财季(4月至6月)财报,营收269.43亿美元,同比增长43%,但归母净亏损6.09亿美元。杨元庆称,AI算力分配正从训练转向推理,目前约50%算力用于训练、50%用于推理,理想比例应为80%推理、20%训练。联想该季度AI相关收入达85亿美元,同比增长60%,占总收入35%。杨元庆认为混合式AI尚处起步阶段,私域数据挖掘空间巨大,AI普及普惠的主力军将是硬件厂商而非模型厂商。行业联想集团杨元庆混合式AI1 个信源在谈事件专题推荐理由:联想财报净亏损但AI收入涨了60%,杨元庆说算力该八成搞推理,还放话要当AI时代的PC之王,看看他凭啥这么自信。原文稍后读已读值得跟进有用关注 联想集团
05:29OpenRouter@OpenRouterAIOpenRouter CEO Alex Atallah 在播客访谈中预测,AI 模型推理将成为科技史上最大市场,甚至可能是人类历史上最大的市场。他认为 AI 竞争不是单一模型的竞赛,而是一个生态系统的快速扩张。该言论发布于 OpenRouter 官方 X 账号,引发 829 次浏览。行业OpenRouterAI推理市场预测推荐理由:OpenRouter 老板说 AI 推理会是史上最大市场,想了解行业风向可以看看。原文稍后读已读值得跟进有用关注 OpenRouter
13:58IT之家(博客/媒体)Gartner 预测 2026 年全球 AI 优化 IaaS 支出将达 420 亿美元,同比增长 96%。其中推理支出预计为 233 亿美元,首次超过训练支出的 190 亿美元。推理任务将占 2026 年 AI 优化型 IaaS 支出的 55%,2027 年升至 59%。Gartner 高级首席分析师 Hardeep Singh 表示,推理支出份额超过训练,标志着组织从实验阶段迈向生产应用。全球 IaaS 总支出预计从 2025 年的 2221.70 亿美元增至 2026 年的 2873.47 亿美元。行业GartnerAI推理IaaS推荐理由:Gartner 预测明年推理支出超训练,说明 AI 应用进入实际落地阶段,做云预算或选型的朋友可以看看这个趋势。原文稍后读已读值得跟进有用关注 Gartner
08:50IT之家(博客/媒体)精选Marvell 在 FMS 2026 上公布 Bravera SC6(MV-SF1410)PCIe Gen6 固态硬盘主控,预计 2026 年第四季度出样。该主控符合 NVMe 2.2 规范,性能是上代 SC5 的 2 倍,面向 AI 推理存储场景,可将更多 KV Cache 从 HBM 迁移到 SSD。它基于 2 个 6 核 Arm Cortex-R82 集群,集成硬件 RAID 引擎和第六代 NANDEdge 技术,提供 16 个 3600MT/s NAND 闪存通道。Marvell 还展示了 Photonic Fabric 光学内存共享方案,可在 50 米内实现最高 32TB 热 KV Cache 卸载,Token 吞吐量提升 2~3 倍。AI产品Bravera SC6MarvellPCIe Gen6推荐理由:Marvell 出了新一代 SSD 主控 Bravera SC6,PCIe Gen6 速度比上代翻倍,还能把 AI 推理的 KV Cache 挪到 SSD 上,做存储的可以关注。原文稍后读已读值得跟进有用关注 Bravera SC6
17:35IT之家(博客/媒体)宜鼎发布 DDR5 MRDIMM Gen2 内存模组,计划 2026 年第四季度起送样。该模组支持 12800MT/s 传输速率,比初代提升 45%。单条容量提供 32GB/48GB/64GB/96GB/128GB 选项,工作温度范围 0~95℃,集成 eFuse 和 TVS 保护。在 AI 模型推理中,MRDIMM 可减少内存带宽对 Token 生成的制约,提升数据处理效率。该模组也适用于云计算、3D 建模、机器人等场景。行业宜鼎DDR5MRDIMM推荐理由:宜鼎新内存速度提升 45%,容量最高 128GB,适合跑 AI 推理和计算密集型任务,2026 Q4 送样。原文稍后读已读值得跟进有用关注 宜鼎
09:47IT之家(博客/媒体)OpenAI 研究员 Jeffrey Wang 称赞 AMD 与 Cerebras 联合开发的 AI 推理解决方案性能“令人难以置信”。该方案整合 AMD Helios 机架(处理提示词与大上下文)和 Cerebras 晶圆级引擎(负责 Token 生成,超低延迟),预计每瓦每秒 token 数量提升 5 倍。Wang 表示,内部在 Cerebras 芯片上运行 OpenAI 模型,推理速度极快,任务切换瞬间完成。行业AMDCerebrasOpenAI10 个信源在谈事件专题推荐理由:OpenAI研究员认证!AMD和Cerebras合作搞的AI推理方案,延迟低到任务秒完成,每瓦性能提升5倍,搞AI推理的可以看看。原文稍后读已读值得跟进有用关注 AMD
13:55IT之家(博客/媒体)71°AMD与Cerebras在Advancing AI 2026活动中宣布联合开发AI推理解决方案,针对超低延迟场景。方案整合AMD Helios机架和Cerebras Wafer-Scale Engine,分别处理提示词/大上下文和Token生成/解码环节。结合使用2个计算引擎,预计将每瓦每秒token吞吐提升5倍。Cerebras晶圆级引擎在单块硅片上集成数十万个核心和数十GB SRAM,以减少外部网络瓶颈。行业AMDCerebrasHelios推荐理由:AMD和Cerebras联手搞推理方案,把Helios和晶圆引擎用在推理上,每瓦token吞吐能翻5倍,专治英伟达Groq组合。原文稍后读已读值得跟进有用关注 AMD
01:51IT之家(博客/媒体)AMD和Cerebras Systems宣布技术合作,整合AMD Helios机架级解决方案与Cerebras晶圆级引擎(搭载大型AI芯片)。组合产品将处理超高吞吐量提示和大上下文窗口,Cerebras提供低延迟token生成能力。计划2026年下半年通过Cerebras Cloud首先推出,后续更广泛开放。受消息影响,Cerebras股价盘中上涨11%。行业AMDCerebrasHelios推荐理由:俩公司把高吞吐和低延迟硬件凑一块,2026年推云服务。合作消息一出,Cerebras股价涨11%,说明市场很看好。原文稍后读已读值得跟进有用关注 AMD
00:14a16z@a16z2022年,比ChatGPT早数月、比Cursor/Claude Code/Codex早几年,Gavin Uberti等三人从哈佛辍学,从零构建了包含芯片、板卡、互连和机架的完整推理系统。a16z的Sarah Wang和Raghu Raghuram认为AI推理是当代最具决定性挑战,并宣布与Etched合作。Etched正在押注定制化推理硬件,其架构从头设计,未依赖现有商用方案。行业Etcheda16zAI推理6 个信源在谈事件专题推荐理由:a16z投资了一家疯狂但认真的公司——Etched在ChatGPT诞生前就赌AI推理需要全新芯片,现在赌对了,值得一看他们的故事。原文稍后读已读值得跟进有用关注 Etched
08:45IT之家(博客/媒体)DeepInfra 在生产环境测试中显示,英伟达 Vera CPU 在智能体 AI 负载下 runc 延迟为 29ms,而英特尔 Sapphire Rapids 为 64ms,速度提升 2.2 倍。相比 AMD Turin 9755,Vera 性能提升 80%。测试采用统一条件:20 物理核、单 NUMA 节点、启用 CPU confinement。Vera 的 IPC 为 3.62,高于英特尔 Granite Rapids 和 Sapphire Rapids 的 2.44。行业NVIDIA VeraIntel Sapphire Rapids智能体推荐理由:英伟达 Vera CPU 在智能体 AI 任务上干翻英特尔,延迟 29ms 对 64ms,直接快 2 倍多,搞 AI 推理的得关注。原文稍后读已读值得跟进有用关注 NVIDIA Vera
21:30IT之家(博客/媒体)精选72°微软宣布将 AMD 最新的 Helios AI 平台(第6代 EPYC Venice 处理器 + Instinct MI455X 加速器)引入 Azure,用于扩充 AI 计算集群。Helios 平台支持最多 256 核 EPYC Venice 与 72 颗 MI455X 加速器,配备 31TB HBM4 显存,理论 FP4 稠密精度算力达 2900 PFLOPS。该平台将驱动三款新 Azure 服务:HDv2(数据处理)、HXv2(EDA)和 ND MI455X v7(AI 推理)。Helios 计划于 2026 年内供货,微软同时扩大与 AMD 的芯片合作。AI产品AMDHeliosAzure推荐理由:微软要用 AMD 最新的 Helios 平台(EPYC Venice+MI455X)跑 AI 推理,32TB 显存、2900 PFLOPS 算力,适合大规模推理负载。原文稍后读已读值得跟进有用关注 AMD
18:24IT之家(博客/媒体)联想在WAIC 2026上展示了全球首款搭载蓝芯LX500处理器的2U机架式服务器——联想问天WR5219 G5。该处理器采用48核异构架构,支持PCIe 5.0通道和DDR5高速内存。服务器提供多种存储和I/O选项,适配AI推理、虚拟化、科学计算、大数据分析等负载。联想强调深度适配本土算力生态,兼容国际和国产CPU、GPU。AI产品联想问天蓝芯LX500RISC-V服务器推荐理由:联想出了首个RISC-V服务器,48核蓝芯LX500,能跑AI推理,国产生态兼容性好。原文稍后读已读值得跟进有用关注 联想问天
07:20Gary Marcus@GaryMarcusGary Marcus 指出 AI 推理成本正经历有史以来最陡峭的商品曲线。他引用数据,中国模型每百万 token 仅需 $0.50,比 Anthropic 的 $56 便宜 112 倍。相比之下,石油价格压缩用了 40 年,半导体用了 20 年,而 AI 推理仅用数月。Anthropic 和 OpenAI 的定价分别为 $56 和 $26,远高于 Meta 的 $1.50、xAI 和 Google 的 $1。行业Gary MarcusAnthropicOpenAI10 个信源在谈事件专题推荐理由:Gary Marcus 用数据告诉你,AI 推理价格一年内垮塌到原来的百分之一,中国模型成本只有 Anthropic 的零头,这对整个行业都是改变游戏规则的事。原文稍后读已读值得跟进有用关注 Gary Marcus
20:49Aadit Sheth@aaditshAI时代,核心技能从回答问题转向提出正确问题。Groq创始人Jonathan Ross通过让用户在X上提问测试其推理硬件,实现爆火。一条展示LLM在Groq上快速运行的视频引发病毒传播,用户生成个性化答案产生魔力。AI产品Groq推理模型提问技巧推荐理由:Groq用‘让用户自己提问’这招,一条推特就火了,教你如何抓住AI时代的本质技能。原文稍后读已读值得跟进有用关注 Groq
10:41IT之家(博客/媒体)精选Rambus 于 7 月 8 日发布新一代 DDR5 RDIMM 芯片组解决方案,支持 9600MT/s 传输速率,相较上代提升 1600MT/s(20%)。该方案面向算力基础设施,可加速 CPU 与内存之间的数据传输,提升高核心数量处理器利用率,增强 AI 推理和 HPC 工作负载性能。核心采用 RCD06 寄存器时钟驱动器芯片,并集成 PMIC5030 电源管理集成电路、SPD Hub 和温度传感器,简化模组设计并优化信号与功率完整性。AI产品RambusDDR5RDIMM推荐理由:Rambus 新芯片把 DDR5 内存速度拉到 9600MT/s,比上一代快 20%,AI 和 HPC 场景更有优势。原文稍后读已读值得跟进有用关注 Rambus
22:59IT之家(博客/媒体)精选澜起科技披露其MRDIMM(符合JEDEC标准的高带宽服务器内存模组)第二子代产品传输速率为12800MT/s,较第一代8800MT/s提升45%。这一速率是主流第三子代RDIMM(6400MT/s)的两倍,旨在缓解AI推理等场景的内存带宽瓶颈。第三子代MRDIMM支持速率规划为16000MT/s。行业预计2026年下半年至2027年将有更多服务器CPU平台支持第二代MRDIMM,推动生态成熟。行业澜起科技MRDIMMJEDEC推荐理由:澜起科技的第二代MRDIMM内存速度达到12800MT/s,比上一代快45%,是普通RDIMM的两倍,专门解决AI推理时的带宽瓶颈,适合关注服务器硬件的朋友。原文稍后读已读值得跟进有用关注 澜起科技
18:03官方一手Pandaily@contact@pandaily.com (Pandaily)阿里云在巴黎和马来西亚柔佛开设新数据中心区域,以应对AI推理需求增长。公司宣布未来几年投资527亿美元用于全球基础设施扩建,这是其战略重心转向海外的举措。阿里云目前在全球30个区域运营。行业Alibaba Cloud巴黎柔佛1 个信源在谈事件专题推荐理由:阿里云砸527亿美元扩张海外,新开了巴黎和柔佛的数据中心,主攻AI推理。看看这个云计算巨头怎么打仗。原文稍后读已读值得跟进有用关注 Alibaba Cloud
02:48Amjad Masad@amasad精选AI推理成本高昂的原因之一是多数工作负载运行在预LLM时代的通用硬件上。Etched从隐身模式亮相,其系统专为现代推理从零设计。公司已获得超过10亿美元客户合同和8亿美元融资。早期测试显示,在推理工作负载上吞吐量、延迟和能效均达到SOTA。首批机架将于今年夏季发货。AI产品EtchedAI推理专用芯片5 个信源在谈事件专题推荐理由:Etched做了专为AI推理优化的芯片,比通用硬件在吞吐、延迟、能效上都做到了目前最好。今年夏天就发货,关注成本的人可以看看。原文稍后读已读值得跟进有用关注 Etched
02:17官方账号NVIDIA AI@NVIDIAAINemotron Labs发布了一项基于5000名Kaggle竞赛参与者数据的研究。他们分析了参与者的解题行为与推理策略。研究揭示了团队协作和多样化方法对提升AI推理效果的关键作用。这些经验可直接应用于现有模型的优化。论文Nemotron LabsKaggleNVIDIA4 个信源在谈事件专题推荐理由:Nemotron Labs用5000个Kaggle实战案例总结了AI推理的改进方法,比看论文更接地气。原文稍后读已读值得跟进有用关注 Nemotron Labs
10:00IT之家(博客/媒体)74°Groq 去年底与英伟达签署 200 亿美元的 LPU 推理技术授权协议,部分团队加入英伟达。2026 年 6 月 22 日,Groq 宣布完成新一轮 6.5 亿美元融资,将转型为 AI 推理云服务供应商。目前其在全球运营 13 座数据中心,服务超 500 万开发者和数千家 AI 企业,Token 周消耗量以万亿计。Groq 计划到 2027 年底拥有 200MW 算力资源,部署最新推理技术和 NVIDIA LPX 系统。行业Groq英伟达LPU9 个信源在谈事件专题推荐理由:Groq 刚拿了 6.5 亿美元,转型做 AI 推理云,背后有英伟达的 LPU 技术和团队支持,目标是 2027 年搞定 200MW 算力。原文稍后读已读值得跟进有用关注 Groq
18:25IT之家(博客/媒体)富国银行报告指出,高通有望深化与 AWS 的 AI 芯片合作,为 AWS 提供 AI200 芯片。AI200 单颗支持 768GB 内存,专为机架级 AI 推理设计。该合作符合 AWS 通过自研或第三方芯片降低推理成本、提升利润率的战略。AI200 预计 2026 年扩大部署,AWS 可能成为高通最大超大规模云端伙伴。目前 AWS 已提供高通 AI100 Ultra 芯片,性价比相对强劲。行业高通AWSAI200推荐理由:高通 AI200 芯片有望进 AWS,推理成本要降原文稍后读已读值得跟进有用关注 高通
19:18官方一手marktechpost@Asif RazzaqNVIDIA 推出了 Dynamo Snapshot,这是一个基于 CRIU 和 cuda-checkpoint 工具的系统,用于在 Kubernetes 上对 vLLM 推理工作节点进行快照和恢复。该系统能够显著加速 AI 推理服务的启动时间,解决冷启动延迟问题。通过保存和恢复推理工作节点的状态,Dynamo Snapshot 使得在 Kubernetes 集群中快速扩缩容成为可能,尤其适用于需要频繁调整推理资源的场景。这一工具对于部署大规模 AI 推理服务的团队来说,可以提升资源利用率和响应速度。AI产品NVIDIADynamo SnapshotKubernetes9 个信源在谈事件专题推荐理由:NVIDIA 用 CRIU 快照解决了 Kubernetes 上 AI 推理的冷启动痛点,做模型推理部署的团队可以直接用这个工具来加速扩缩容,值得关注。原文稍后读已读值得跟进有用关注 NVIDIA
21:45IT之家(博客/媒体)撼与 Sparkle 在台北电脑展上展示了首款单槽设计的 Intel Arc Pro B70 32GB 显卡,型号为 Sparkle Intel Arc Pro B70 32 GB Blower 1S。该卡采用紧凑单槽形态,一台工作站最多可安装8块,实现总计256GB显存,能本地运行超2000亿参数的AI大模型。它搭载完整 BMG-G31 GPU,配备32个Xe2核心与32GB显存,定位AI、内容创作等专业负载。单槽版本TGP降至160W,虽可能影响持续性能,但大幅提升空间利用效率。该卡是了解Intel“Big Battlemage”架构的唯一窗口,售价尚未公布,预计近期上市。AI产品显卡工作站AI推理推荐理由:单槽设计让工作站能塞进8块GPU,256GB显存直接跑2000亿参数大模型,做本地AI推理或内容创作的团队值得关注,空间和预算都能省不少。原文稍后读已读值得跟进有用关注 显卡
09:27IT之家(博客/媒体)精选据韩媒报道,SK海力士计划在大连二厂建设约250层的FG(浮栅)结构3D NAND产线。目前主流闪存原厂均采用CT(电荷阱)结构,SK海力士通过收购英特尔闪存业务保留了FG技术。公司已完成200层以上FG NAND研发,计划2026年Q3建设中试线,2027年H2实现量产。FG结构更适合QLC NAND,而AI推理工作负载对读取密集型QLC SSD需求旺盛,此举将巩固其在AI存储市场的竞争力。行业SK海力士FG NANDQLC推荐理由:SK海力士押注FG NAND路线,直接服务于AI推理对高容量QLC SSD的爆发需求,做AI基础设施或存储方案的团队值得关注这一技术动向。原文稍后读已读值得跟进有用关注 SK海力士
19:13IT之家(博客/媒体)撼与在COMPUTEX 2026上展示了多款eGPU设备,其中eGPU Studio-G Dual支持安装两块显卡,突破了传统单卡限制。该设备采用雷电5连接,内置1850W或1650W的ATX 3.1电源,为高端双卡配置提供充足电力。同时展出的还有eGPU Studio-G Ultra 850和面向内容创作者的eGPU Creator Station,后者内置RTX 3060 12GB显卡。这些设备均支持英特尔的Thunderbolt Share技术,适合需要多GPU加速的创作者和AI开发者。AI产品eGPU雷电5双显卡推荐理由:双卡eGPU解决了多GPU工作流的外接瓶颈,做AI训练或3D渲染的团队可以关注这款雷电5方案,直接提升扩展性。原文稍后读已读值得跟进有用关注 eGPU
19:11IT之家(博客/媒体)TrendForce 报告显示,2026 年第一季度 DRAM 内存产业营收环比暴增 81%,达到 970 亿美元。增长主要源于 AI 应用从训练转向推理,云服务商加速建设通用型服务器,带动 RDIMM 需求强劲。产能挤占导致一般型 DRAM 合约价单季几乎翻倍(+93~98%)。预计第二季度合约价将继续上涨 58~63%,且供不应求态势难以改变,因原厂库存见底且产能提升有限。行业DRAMAI推理服务器推荐理由:DRAM 价格暴涨直接推高服务器和 PC 成本,做硬件采购、云基础设施或 AI 推理部署的团队需要提前规划预算,建议关注后续价格走势。原文稍后读已读值得跟进有用关注 DRAM
19:21Ate-a-Pi@svpino一个创新的AI推理市场概念被提出,它能够根据实时价格将请求路由到最便宜的合格模型。目前用户通常按固定费率支付给供应商,但这种方式即将改变。该市场声称可节省高达87%的推理成本。这一想法旨在打破固定定价模式,让AI推理更经济高效。AI产品推理模型成本优化市场/平台推荐理由:做AI推理的团队终于有了降本利器——动态路由到最便宜模型,直接省87%成本,做模型部署和成本优化的建议点开看看。原文稍后读已读值得跟进有用关注 推理模型
12:51IT之家(博客/媒体)精选英特尔在COMPUTEX前夕进一步介绍了其面向AI推理的数据中心GPU“Crescent Island”,该卡将于今年晚些时候面世。它支持从FP4到FP64的多种数据类型,配备高达480GB的LPDDR5x内存,采用350W功耗的PCIe AIC设计,主打每瓦词元效率。英特尔确认,其Xe3P GPU架构将应用于PC、数据中心、边缘和工作站四大领域,包括下一代PC芯片。AI产品英特尔数据中心GPUAI推理推荐理由:做AI推理部署的团队终于有了英特尔的高内存选项——480GB LPDDR5x和350W功耗设计,适合需要大模型推理但不想堆多卡的场景,值得关注。原文稍后读已读值得跟进有用关注 英特尔
11:08Fireworks AI@FireworksAI_HQ精选Fireworks AI 发布了 Serverless 2.0,提供三种服务路径:Standard(弹性默认)、Priority(拥堵时最后降级,价格约 1.5 倍)和 Fast(Kimi K2.6 和 GLM 5.1 上超 100 tok/s)。该方案解决了传统 AI 推理中需要预留 GPU 才能保证可靠性的痛点,让开发者按需使用、灵活选择性能与成本。用户无需提前锁定资源即可获得高吞吐和低延迟,降低了 AI 部署的门槛。AI产品FireworksServerless 2.0AI推理推荐理由:做 AI 推理部署的团队终于不用为可靠性提前锁死 GPU 了——Fireworks 的三种路径按需选,Kimi K2.6 和 GLM 5.1 还能跑 100+ tok/s,值得试试。原文稍后读已读值得跟进有用关注 Fireworks
22:12IT之家(博客/媒体)慧荣(Silicon Motion)发布了面向AI推理与KV缓存工作负载优化的固态硬盘主控芯片SM2524XT。该主控采用台积电6nm制程,拥有4个内核和DRAM-less架构,支持PCIe Gen5×4,顺序读取速率达14GB/s,随机性能代际提升25%。慧荣指出,KV缓存已成为AI PC响应速度的关键瓶颈,SM2524XT专为应对AI驱动的高度碎片化、延迟敏感的随机读写操作而设计,能在持续推理会话中保持稳定性能。AI产品慧荣SSD主控AI推理推荐理由:AI PC和边缘推理场景的存储瓶颈终于有了针对性解决方案,做AI硬件或部署本地模型的开发者值得关注这款主控的实际表现。原文稍后读已读值得跟进有用关注 慧荣
17:18IT之家(博客/媒体)精选据路透社报道,字节跳动正在开发自有CPU,以应对AI推理阶段对CPU的高需求及芯片价格上涨、供应短缺问题。该项目处于早期阶段,计划部署在自有服务器和数据中心,支持内部运营及Coze等智能体产品。字节跳动同时探索基于Arm和开源RISC-V的两条架构路线,并已接触外部合作伙伴参与设计及制造。此举与谷歌、亚马逊等云服务商的自研芯片趋势一致,旨在降低成本并提升性能。行业字节跳动自研CPUAI推理推荐理由:AI行业转向推理导致CPU短缺和涨价,字节跳动自研芯片是降本增效的关键一步。做AI基础设施或智能体开发的团队,值得关注这一趋势对供应链和成本的影响。原文稍后读已读值得跟进有用关注 字节跳动
10:50官方账号arXiv cs.LG@Vasilios A. Siris, Adamantia Stamou, George D. Stamoulis, Konstantinos Varsos, Ramin Khalili精选AI 服务的广泛使用引发了环境可持续性担忧,其中 AI 推理的碳排放是主要贡献者。本文提出一个框架,基于用户对推理质量和延迟的估值以及环保意识,设计激励措施,同时权衡碳排放与这两个 QoE 参数。该框架可适应不同 AI 模型规模和资源分配下的权衡。激励通过实用的两级服务订阅实现,用户以折扣换取碳排放减少。在碳强度高时,折扣服务允许 AI 提供商以较低质量和较高延迟服务部分推理请求。论文AI推理碳排放用户激励推荐理由:这篇论文为 AI 服务提供商提供了一个实用方案,通过用户激励平衡碳排放与服务质量,关注绿色 AI 的团队可以直接参考其两级订阅设计。原文稍后读已读值得跟进有用关注 AI推理
23:26IT之家(博客/媒体)爆料人@结城安穗-YuuKi_AnS 释出了英特尔数据中心GPU“Crescent Island”的PCB图片。该显卡采用PCIe Gen5+接口,配备20个LPDDR5X内存焊盘,总容量达160GB,支持15相核心供电与3相内存供电。它基于Xe3P微架构,面向风冷服务器,专为AI推理工作负载优化,预计2026年下半年向客户出样。此次曝光揭示了其硬件规格和设计细节,标志着英特尔在AI推理领域的进一步布局。AI产品英特尔Crescent IslandAI推理推荐理由:数据中心AI推理市场迎来新玩家,做AI部署和服务器优化的团队值得关注——160GB LPDDR5X内存和Xe3P架构的配置,可能改变推理成本格局。原文稍后读已读值得跟进有用关注 英特尔
16:20IT之家(博客/媒体)联想集团董事长杨元庆在财报沟通会上表示,AI基础设施正从训练向推理快速转移,目前70-80%的GPU服务器用于训练,未来将反转至70%用于推理、30%用于训练。他强调训练需求不会减少,但仅靠大型云服务商已无法满足需求。联想2026财年AI相关收入同比增长105%,占总营收33%,第四季度占比达38%。行业联想GPU服务器AI推理推荐理由:杨元庆的预测揭示了AI算力市场的结构性拐点——推理需求将主导未来,做AI应用部署和基础设施规划的团队值得关注这一趋势,提前调整算力采购策略。原文稍后读已读值得跟进有用关注 联想
16:43官方账号阿里云 Alibaba Cloud@alibaba_cloud阿里云宣布 Apache RocketMQ 5.x 引入 LiteTopic 功能,专为 AI 推理任务设计。传统消息队列限流无法应对 AI 推理的长耗时和不可预测性,LiteTopic 提供毫秒级细粒度流量治理,能有效管理 AI 推理流量。该功能解决了 AI 场景下消息队列的痛点,适合需要高精度流量控制的 AI 应用团队。AI产品RocketMQAI推理流量治理推荐理由:AI 推理任务流量波动大,传统 MQ 限流不够用——RocketMQ 5.x 的 LiteTopic 给了毫秒级控制能力,做 AI 推理服务或消息队列架构的团队值得关注。原文稍后读已读值得跟进有用关注 RocketMQ