老黄难得登上微软发布会,聊了段 1995 年的旧事,讲清了 Windows、GeForce 和 CUDA 这条线的来龙去脉。
#CUDA
共 26 条 · 7 天 5 条 · 30 天 10 条
信息流里打上「CUDA」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月8日
黄仁勋现身微软 Surface 发布会:没有 Windows 就没有 CUDA
黄仁勋称 RTX Spark 是唯一本地原生运行所有应用的电脑
英伟达发布会说 RTX Spark 测了 1200 多款应用,DirectX 和 CUDA 程序都能本地跑,想搞本地 AI 的可以关注下。
10月7日
10月5日
9月30日
9月29日
KernelZero:Proposer 与 Coder 协同进化生成高性能 GPU Kernel
一个 7B 模型在 CUDA 上干过 Claude-4.5-Sonnet,靠的是两个小模型互相出题互相训练,生成 GPU kernel 的可以看看这套思路。
9月28日
Modal 推出 GPU Glossary 术语手册,按四层拆解 GPU 技术栈
Modal 出了一份免费 GPU 术语手册,从 CUDA 执行模型到性能调优一条链讲清楚,想搞懂 GPU 编程的可以当教材啃
9月22日
9月10日
英伟达 CUDA Toolkit 13.4 首次支持 Windows on Arm64
英伟达首次让 Windows Arm64 系统原生支持 CUDA,为 RTX Spark PC 铺路,开发者现在可以直接在 Windows Arm64 上编译 CUDA 应用。
9月5日
8月29日
8月23日
8月17日
8月13日
8月5日
7月30日
Kernel Forge: 用MCTS优化CUDA内核的开源Agent Harness
想又快又稳地优化CUDA内核?Kernel Forge用MCTS自动探索,比手动写靠谱多了,实测14个内核超基线。
7月28日
Claude 周末无人干预跑通 AMD MI355X,CUDA 生态被 AI 突围
Claude 自己一周末就调通了 AMD 新显卡,人类工程师全程没写代码。AMD 还给 AI 出了专用工具,以后换芯片可能跟装 App 一样简单。
7月26日
7月13日
Together AI发布ParallelKernelBench,测试LLM多GPU CUDA编码能力
Together AI搞了个新基准ParallelKernelBench,专门测AI写多GPU CUDA代码的能力,比单核测试更贴近真实场景。
7月9日
7月3日
6月29日
LLMs写GPU内核能力提升,ParallelKernelBench基准发布
Together Compute搞了个ParallelKernelBench,专门测LLM能不能写好复杂的多GPU内核,比单GPU难多了,感兴趣的话可以去现场听分享。
5月15日
产品00:48
MLX CUDA后端测试全过,苹果框架杀入NVIDIA生态MLX打通CUDA后,做本地AI推理的开发者终于可以一套代码跑通Mac和NVIDIA显卡,省去PyTorch兼容折腾,建议关注这个框架的跨平台潜力。