tflops·general

TFLOPs

别名
首次出现
2026-06-11
最近出现
2026-07-23
累计提及
22
§ 01综述

TFLOPs(每秒万亿次浮点运算)是衡量AI芯片计算性能的核心指标,尤其在深度学习训练和推理中直接决定模型运行速度。近期,多家厂商发布了突破性芯片设计,从传统架构向软件定义、近存计算等方向演进,以提升单位功耗下的有效TFLOPs。

TFLOPs近期进展

  • 东方算芯首次展出全球首颗软件定义近存计算3D AI芯片DF1000:该芯片采用3D堆叠与近存计算技术,通过软件定义数据流实现动态算子编排,理论上可减少数据搬运带来的功耗损耗,从而在相同TFLOPs下获得更高实际吞吐。具体算力参数尚未披露,但架构创新被视为突破“内存墙”的关键路径。
  • 中国自研AI芯片520 TFLOPS@14nm:软件定义计算架构突破:这款芯片在14nm工艺下实现了520 TFLOPS FP16算力,采用软件定义计算架构,允许用户通过编程重塑计算单元以适配不同模型。与同工艺竞品相比,其能效比提升约40%,但制程落后于国际领先的7nm以下节点。
  • NVIDIA 扩展 Jetson Thor 计算机家族,新增 T3000、T2000 模组:新模组基于Thor架构,T3000提供200 TOPS INT8算力(约100 TFLOPS FP16),T2000为100 TOPS。它们专为边缘AI场景设计,强调在低功耗(T3000为75W)下实现持续高性能,同时支持多模态模型实时推理。
  • 当前焦点与观察点

    TFLOPs正从单一数字竞争转向“有效算力”的比拼。一方面,软件定义架构允许芯片动态调整计算资源,如东方算芯和中国自研芯片的尝试,使得名义TFLOPs更贴近实际任务需求;另一方面,近存计算和3D堆叠(如DF1000)通过减少数据搬运延迟,提升单位TFLOPs的利用率。此外,NVIDIA等厂商在边缘侧推出不同TFLOPs梯度的模组(T2000/T3000),表明市场正根据功耗、成本和应用场景进行精细化分层。值得关注的是,单纯追求高TFLOPs在推理场景中已非最优解——摩尔线程王东指出,推理市场需要“解决方案组合”,而非单一高性能芯片。未来,单位瓦特TFLOPs(能效比)和实际推理延迟可能成为更重要的评价标准。

    § 02相关报道10 条在档
    1. 01
      DeepSeek-v3 671B 测试:英伟达 Blackwell GB300 刷新 MoE 预训练世界纪录
      IT之家
    2. 02
      NVIDIA Blackwell Ultra 创纪录:预训练 DeepSeek-V3 671B 达 1648 TFLOPS/GPU
      NVIDIA AI
    3. 03
      摩尔线程王东:推理市场没有万能芯片,是解决方案组合
      IT之家
    4. 04
      东方算芯首次展出全球首颗软件定义近存计算3D AI芯片DF1000
      IT之家
    5. 05
      NVIDIA 扩展 Jetson Thor 计算机家族,新增 T3000、T2000 模组
      IT之家
    6. 06
      中国自研AI芯片520 TFLOPS@14nm:软件定义计算架构突破
      Pandaily
    7. 07
      操作级视觉令牌跳过:高效多模态大模型推理方法
      arXiv cs.AI
    8. 08
      映泰发布边缘AI系统MS-NAT5000,搭载NVIDIA Jetson Thor模组
      IT之家
    9. 09
      Google发布TPU v2至Ironwood五代架构论文:30倍能效提升
      Jeff Dean
    10. 10
      摩尔线程 MTT S5000 完成 MiniMax M3 模型 Day-0 适配
      IT之家
    § 03邻近话题

    本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

    /topic/TFLOPs