PyTorchCon 北美大会 10 月 20-21 在 San Jose 办,Google 是钻石赞助商,议程从底层硬件讲到 Agent 系统,做深度学习的可以看看。
#PyTorch
Meta 要在 PyTorch 大会上讲 KernelAgent,用多智能体自动写 Triton 内核,100 个任务上比 torch.compile 快 1.56 倍,写算子的人可以看看。
Meta 的 Zongwei Zhou 要在 PyTorchCon 讲 TorchTPU 和智能体开发,说说怎么让 AI 工作负载跨硬件跑得动又跑得快。
IBM 把自家 Spyre 芯片接进了 PyTorch,靠的是设备、内存、编译这些现成抽象层,想了解框架如何兼容多硬件的可以看看这篇官方博客。
PyTorch 官方大会 10 月 20-21 日在圣何塞办,今年加了新手 track,还有卫星影像遥感的实战分享,做开发的话可以看看。
AWS 的 Robert Hundt 会在 PyTorchCon 讲 Trainium 怎么跑上原生 PyTorch,从 torch.compile 到 TorchAO 都有,做训练优化的别错过。
DeepSpeed 常被当成只做 ZeRO 显存优化,这场演讲会讲它的自动张量、序列、专家并行,还带基准数据,做大模型训练的可以看看。
PyTorch 官方宣布的活动,Red Hat、NVIDIA、IBM 三家联合办,讲 vLLM、Ray 这些工具怎么进企业生产环境,搞部署的可以关注
AWS 两位工程师在 PyTorch 大会上手把手教你从 torch.profiler 调到硬件周期级,Trainium 优化性能的实用流程。
IBM 和 Red Hat 会在 PyTorch 大会上讲 Spyre 加速器和分布式推理的落地细节,做底层基础设施的可以去听。
PyTorchCon 北美大会下个月开,两天议程全围绕 vLLM、Ray、DeepSpeed 这些开源框架,做推理和训练的可以去看看。
PyTorch 官方把 Helion 接进 vLLM,一套 GEMM 代码自动选最优算法,在 Hopper 上跑赢 CUTLASS 和 DeepGEMM,搞推理部署的可以看看。
Arm 的人在 PyTorch 大会讲怎么用 ExecuTorch 把智能体跑进机械臂和穿戴设备,做边缘部署的可以去听。
Red Hat 的人在 PyTorch Conference 讲怎么用 vLLM 把智能体推理跑到 7x24 企业级,聊 KV cache、并发这些真问题,做后端的可以看看。
Raschka 又更新了,这期手把手教你用 PyTorch 算 token 概率给模型答案打分,还搭了一个 self-refinement 循环,最后跑 MATH-500 看效果。
训练 LLM 时 loss 突然炸了却找不到原因?OpGuard 能逐比特比对两次训练,直接定位出错的那个算子。
PyTorch 的 ExecuTorch 黑客松开放报名了,10 月中在旧金山,现场有骁龙笔记本和 Galaxy 手机可以上手部署模型,做端侧 AI 的可以去组队。
AMD 的工程师讲怎么在 1000 多张 MI355X 上跑 MXFP8 预训练,TorchAO 加 TorchTitan 的完整方案,做训练的可以听听