8月5日
01:32
01:32官方账号Cursor@cursor_ai
精选
Cursor 宣布其 MoK 方案已投入训练任务,覆盖数万张 GPU。相比此前基于 DeepEP 的技术栈,端到端训练吞吐提升至 1.41 倍。MoK 已在生产环境验证,用于 Cursor 的大规模训练基础设施。
事件专题

推荐理由:Cursor 说 MoK 已在数万 GPU 上跑生产,比旧 DeepEP 栈端到端快 1.41 倍,搞大规模训练的可以看。
7月22日
12:10
12:10Stanford AI Lab@StanfordAILab
精选
斯坦福AI实验室的Tatsunori Hashimoto介绍了Gigatoken,一个超快速的tokenizer。它通过贴近硬件和编写状态机,将tokenization速度提升了数量级。研究者表示再也不需要等待tokenization完成再开始训练。
事件专题

推荐理由:Gigatoken解决了tokenization的瓶颈,训练前不用再傻等,速度提升非常明显。
6月29日
13:49
6月26日
00:55
00:55官方一手AWS Machine Learning Blog@Andrea Gallo
精选
本文介绍如何在Amazon SageMaker AI上利用NVIDIA Blackwell架构优化训练配置。包括根据模型大小(1B到64B参数)选择合适精度格式,调整batch size和序列长度以利用Blackwell扩展内存,以及策略性应用激活检查点。通过P6-B200实例启动分布式训练,提供一套实用的训练调优框架。
事件专题

推荐理由:AWS发了篇实战教程,教你用NVIDIA Blackwell在SageMaker上调优训练,从选精度到调batch size都讲清了,搞大模型训练的人别错过。