观点:DeepSeek V4.1 训练复杂度更高但信息流更简洁
一条关于 DeepSeek V4.1 的训练观察:没做 dense warmup 也能训练顺利,作者解释了为什么这种设计值得 scale up。
一条关于 DeepSeek V4.1 的训练观察:没做 dense warmup 也能训练顺利,作者解释了为什么这种设计值得 scale up。
这是 @gauri__gupta 为 AI 实验室技术面试准备的笔记,系统梳理了训练和推理中的关键优化技术,比如 KV Cache、ZeRO 和 DualPipe,对准备面试的人很有帮助。
摩尔线程把256张GPU连成一体,延迟压到亚微秒,两柜顶别人一堆。还跑通了万亿参数MoE,实打实的国产算力。