671b·general

671b

别名
首次出现
2026-06-12
最近出现
2026-07-22
累计提及
13
§ 01综述

671B 近期进展

671B,指的是DeepSeek-V3模型,这是一种基于MoE(多智能体)架构的大语言模型。近期,该模型在性能和效率方面取得了显著进展。

1. 性能突破 DeepSeek-v3 671B 测试:英伟达 Blackwell GB300 刷新 MoE 预训练世界纪录

英伟达Blackwell GB300服务器上运行的DeepSeek-V3 671B模型,刷新了MoE预训练的世界纪录,达到1648 TFLOPS/GPU的效率。

2. 模型加速 NVIDIA Blackwell Ultra 创纪录:预训练 DeepSeek-V3 671B 达 1648 TFLOPS/GPU

NVIDIA的Blackwell Ultra平台助力DeepSeek-V3 671B达到新高度,显著提高了训练速度。

3. 新方法探索 EcoSpec:成本感知的MoE模型投机解码加速方法

研究人员提出了一种名为EcoSpec的新方法,旨在提高MoE模型在解码阶段的效率。

4. 技能优化 基于李代数胚的智能体技能优化

该研究探讨了如何通过李代数胚优化智能体的技能。

当前焦点与观察点

当前,671B模型的研究集中在如何通过技术创新提升模型性能和效率。同时,研究者们也在探索如何将模型应用于更多实际场景,如罕见病诊断和LLM服务。

在加速训练和推理方面,英伟达的平台和软件工具发挥了重要作用。此外,成本感知和性能优化的研究也是当前热点。

§ 02相关报道10 条在档
  1. 01
    DeepSeek-v3 671B 测试:英伟达 Blackwell GB300 刷新 MoE 预训练世界纪录
    IT之家
  2. 02
    NVIDIA Blackwell Ultra 创纪录:预训练 DeepSeek-V3 671B 达 1648 TFLOPS/GPU
    NVIDIA AI
  3. 03
    EcoSpec:成本感知的MoE模型投机解码加速方法
    arXiv: DeepSeek
  4. 04
    基于李代数胚的智能体技能优化
    arXiv: DeepSeek
  5. 05
    网格搜索前的思考:面向LLM服务的Floor-First分流方法
    arXiv: DeepSeek
  6. 06
    网格搜索前先思考:LLM服务的Floor-First分诊方法
    arXiv: DeepSeek
  7. 07
    CAEE: 成本感知的专家执行框架提升多设备MoE推理
    arXiv: DeepSeek
  8. 08
    用于加速罕见病诊断的专用推理大语言模型:随机AI医生辅助试验
    arXiv: DeepSeek
  9. 09
    英伟达MLPerf纪录:2.02分钟训练DeepSeek-V3 671B,提速60%
    IT之家
  10. 10
    Operadic Consistency:无标签检测LLM组合推理失败的新信号
    arXiv cs.LG
§ 03邻近话题

本页综述由 AITOP 基于公开报道整理。原报道版权归各自来源所有。

/topic/671b