6月24日
12:00
12:00官方账号arXiv cs.AI@Adhitya Charan, Adwaid Suresh, Anuj Kumar, Aparna A, Dhanakumar K, Dharun M S, Dinesh G, Goutham Kumar Reddy K, Harshini V M, Jenifa D, Jona Delcy C A, Kathirvel S, Killi Uma Maheswara Rao, Kiruthik Kanna M, Kurra Vishnu Sai, Madhumithaa G K, Navin Kumar, Ram Charan Golla, Revathi T, Rishikkanth R, Sanjay Krishna M, Surendra Vendra
BluTrain是一个用标准C++和CUDA实现的AI训练框架。在8-GPU 6000 Ada系统上训练124M参数GPT-2模型(FP32),其吞吐量达407K tokens/s,比PyTorch的395K tokens/s高约3%。同时内存占用减少22%,且严格保持数值精度。框架包含原生实现的张量模块、反向模式自动微分、线性代数库、缓存分配器、分布式执行和MLIR编译器。
推荐理由:这个新框架用C++从头写,训练GPT-2比PyTorch快3%且省内存22%,适合追求极致性能的开发者。
5月26日
10:16
10:16官方一手pandaily@contact@pandaily.com (Pandaily)
精选72°
Bingbi AI 开源了 BitCPM-CANN 训练框架,支持在国产 AI 加速器上进行 1.58-bit 模型训练。相比全精度训练,该框架可将推理内存需求降低最多六倍,显著降低硬件门槛。这一开源举措有望推动国产算力生态发展,让更多开发者和团队在国产芯片上高效训练和部署大模型。

推荐理由:国产算力生态终于有了低精度训练的利器——1.58-bit 训练框架让国产芯片也能高效跑大模型,做国产 AI 部署的团队可以直接拿来用,内存省六倍,值得关注。