№tflops·general
TFLOPs
别名
- 首次出现
- 2026-06-11
- 最近出现
- 2026-07-23
- 累计提及
- 22
§ 01综述
TFLOPs(每秒万亿次浮点运算)是衡量AI芯片计算性能的核心指标,尤其在深度学习训练和推理中直接决定模型运行速度。近期,多家厂商发布了突破性芯片设计,从传统架构向软件定义、近存计算等方向演进,以提升单位功耗下的有效TFLOPs。
TFLOPs近期进展
东方算芯首次展出全球首颗软件定义近存计算3D AI芯片DF1000:该芯片采用3D堆叠与近存计算技术,通过软件定义数据流实现动态算子编排,理论上可减少数据搬运带来的功耗损耗,从而在相同TFLOPs下获得更高实际吞吐。具体算力参数尚未披露,但架构创新被视为突破“内存墙”的关键路径。
中国自研AI芯片520 TFLOPS@14nm:软件定义计算架构突破:这款芯片在14nm工艺下实现了520 TFLOPS FP16算力,采用软件定义计算架构,允许用户通过编程重塑计算单元以适配不同模型。与同工艺竞品相比,其能效比提升约40%,但制程落后于国际领先的7nm以下节点。
NVIDIA 扩展 Jetson Thor 计算机家族,新增 T3000、T2000 模组:新模组基于Thor架构,T3000提供200 TOPS INT8算力(约100 TFLOPS FP16),T2000为100 TOPS。它们专为边缘AI场景设计,强调在低功耗(T3000为75W)下实现持续高性能,同时支持多模态模型实时推理。
当前焦点与观察点
TFLOPs正从单一数字竞争转向“有效算力”的比拼。一方面,软件定义架构允许芯片动态调整计算资源,如东方算芯和中国自研芯片的尝试,使得名义TFLOPs更贴近实际任务需求;另一方面,近存计算和3D堆叠(如DF1000)通过减少数据搬运延迟,提升单位TFLOPs的利用率。此外,NVIDIA等厂商在边缘侧推出不同TFLOPs梯度的模组(T2000/T3000),表明市场正根据功耗、成本和应用场景进行精细化分层。值得关注的是,单纯追求高TFLOPs在推理场景中已非最优解——摩尔线程王东指出,推理市场需要“解决方案组合”,而非单一高性能芯片。未来,单位瓦特TFLOPs(能效比)和实际推理延迟可能成为更重要的评价标准。