10:19官方一手arXiv: DeepSeek@Shiju Zhao, Jiacheng Yang, Qihang Chen, Junhao Hu, Jiaqi Zheng, Guihai Chen, Xusheng Chen精选CoRun是一个面向LLM推理的调度系统,通过隔离预填充和固定形状批处理解码实现确定性输出。相比现有batch-invariant内核方案,CoRun无需牺牲性能即可保证结果一致。在Qwen和DeepSeek等模型上,CoRun吞吐量提升15%至324%,首token延迟平均降低51.8%,每token输出延迟平均降低48.6%。其核心洞察是大多数内核虽非批次不变,但具有位置不变性。论文CoRunQwenDeepSeek推荐理由:这篇论文说用简单填充法就能让LLM推理结果确定,不用牺牲速度,比之前的方案快了不少,还在Qwen和DeepSeek上试过。原文稍后读已读值得跟进有用关注 CoRun
22:07官方账号NVIDIA AI@NVIDIAAI精选77°NVIDIA发布官方skills插件,Cursor智能体可调用300多项技能,覆盖CUDA、NeMo、RAG等30多个产品。开发者只需描述构建目标,插件会自动推荐并执行合适技能。该插件已上架Cursor marketplace,完整技能目录托管在GitHub。AI产品NVIDIACursor智能体10 个信源在谈事件专题推荐理由:NVIDIA给Cursor出了个官方插件,装完你的智能体就会用CUDA和RAG这些技能了,搞开发更省事。原文稍后读已读值得跟进有用关注 NVIDIA
15:47量子位@听雨英伟达用了20年构建的CUDA生态,被AI用10小时撕开缺口。这一技术绕过了CUDA专有壁垒,将代码迁移到其他GPU平台的难度大幅降低。CUDA作为英伟达核心护城河的地位因此遭到动摇。AI模型CUDA英伟达GPU编程推荐理由:老黄攒了20年的CUDA家底,被一个AI用10小时挖穿了。以后换显卡跑模型,不用再手动改代码。原文稍后读已读值得跟进有用关注 CUDA
09:46IT之家(博客/媒体)AMD高管称,与英伟达的AI芯片竞争中,开放是重要优势,核心是开源软件ROCm。CEO苏姿丰在财报电话会上表示,ROCm处于转折点,过去一年开源社区贡献量增长10倍。AMD认为这能低成本调用全球数千名工程师的技术贡献,加快AI软件开发,并让自家芯片更适配AI智能体。AMD最新季度营收115亿美元,资本支出约8.08亿美元,同比接近3倍;过去一年AMD股价涨约193%,英伟达约20%。行业AMDNvidiaROCm10 个信源在谈事件专题推荐理由:AMD说自家比英伟达更开放,ROCm开源贡献一年涨10倍,还聊了财报和股价,想了解AI芯片竞争可以看。原文稍后读已读值得跟进有用关注 AMD
00:08elvis@omarsar0精选Kernel Forge是一个开源agent harness,能直接改写PyTorch模型的CUDA内核。它覆盖视觉、扩散和LLM三类工作负载。采用蒙特卡洛树搜索(MCTS)而非线性生成-修复链,并提供GUI监控进度。在NVIDIA DGX Spark(GB10 GPU)上,经过每核50次优化迭代,它在四个模型中优化了14个内核,使其超越PyTorch基线。性能提升主要来自harness结构和原地重整合,而非更强的LLM。论文Kernel ForgeCUDA代码优化10 个信源在谈事件专题推荐理由:想又快又稳地优化CUDA内核?Kernel Forge用MCTS自动探索,比手动写靠谱多了,实测14个内核超基线。原文稍后读已读值得跟进有用关注 Kernel Forge
00:05IT之家(博客/媒体)78°Anthropic 团队仅用一名工程师将 Claude 接入 AMD MI355X 机架,经一个周末无代码修改即成功运行,性能曲线持续上涨。AMD 发布 ROCm.AI 工具集,包含 AMD Skills 和 Hyperloom,后者让 MiniMax M3 输出速度提升 38%。Anthropic 计划在 AMD Helios 系统部署最高 2GW Instinct GPU,首批 1GW 于 2027 年上半年启动。AI Agent 可直接读取芯片指令集并自动调优,将 CUDA 数十年的生态优势压缩为按任务追赶。AI产品ClaudeAMDMI355X10 个信源在谈事件专题推荐理由:Claude 自己一周末就调通了 AMD 新显卡,人类工程师全程没写代码。AMD 还给 AI 出了专用工具,以后换芯片可能跟装 App 一样简单。原文稍后读已读值得跟进有用关注 Claude
06:22宝玉@dotey71°Anthropic技术员工Julian Schrittwieser在X上发推。他讽刺性地欢迎NVIDIA CEO黄仁勋现在相信开源。他期待CUDA和GPU驱动程序开源。行业AnthropicNVIDIAJensen Huang10 个信源在谈事件专题推荐理由:Anthropic员工调侃老黄态度变,想看CUDA和GPU驱动真开源吗?原文稍后读已读值得跟进有用关注 Anthropic
10:59官方账号Together AI@togethercompute精选Together AI团队在@aiDotEngineer大会上发布了ParallelKernelBench,一个开源基准测试。该基准专门评估大语言模型能否为通信密集型多GPU工作负载编写高效的CUDA内核。与现有单GPU测试不同,ParallelKernelBench聚焦真实场景下的并行内核性能。开发者可使用该基准对比不同LLM的代码生成质量。AI模型ParallelKernelBenchTogether AICUDA推荐理由:Together AI搞了个新基准ParallelKernelBench,专门测AI写多GPU CUDA代码的能力,比单核测试更贴近真实场景。原文稍后读已读值得跟进有用关注 ParallelKernelBench
21:04IT之家(博客/媒体)73°法国竞争管理局官员确认,针对英伟达的反垄断调查已接近尾声,预计很快出具正式异议声明。该调查始于2023年9月法方突击检查英伟达法国办公室,2024年年中发布的报告指出整个生成式AI行业高度依赖英伟达CUDA平台。调查聚焦两大问题:市场对CUDA的强依赖使开发者难以转向其他硬件;英伟达对CoreWeave等AI云计算公司的投资可能强化其市场优势。英伟达占据全球AI加速器市场超70%份额,若认定滥用市场支配地位,最高可被处以全球年营业额10%的罚款(数十亿美元)。行业英伟达CUDA反垄断推荐理由:法国准备正式指控英伟达,原因是他们太依赖CUDA和投资云公司,最高可能罚几十亿美元,这案子会影响整个AI芯片格局。原文稍后读已读值得跟进有用关注 英伟达
10:14官方账号LMSYS Org (SGLang)@lmsysorgLM-SYS在推文中强调软件是AI基础设施的复合力量。他们指出开源意味着每一份进步都能惠及所有人。该组织自豪地基于NVIDIA CUDA原生构建。行业LM-SYSNVIDIACUDA6 个信源在谈事件专题推荐理由:LM-SYS说软件才是核心,开源能让每个人受益,还特意cue了NVIDIA CUDA。观点很直白。原文稍后读已读值得跟进有用关注 LM-SYS
13:51官方账号Together AI@togethercompute精选Together Compute推出ParallelKernelBench开放基准测试,专门评估LLM编写多GPU内核的难度。该基准基于50个真实CUDA通信问题,性能取决于通过NVLink高效移动数据。测试结果将于6月30日在aiDotEngineer World's Fair上由Simran Arora分享。AI模型ParallelKernelBenchTogether ComputeCUDA推荐理由:Together Compute搞了个ParallelKernelBench,专门测LLM能不能写好复杂的多GPU内核,比单GPU难多了,感兴趣的话可以去现场听分享。原文稍后读已读值得跟进有用关注 ParallelKernelBench
13:50官方账号阿里云 Alibaba Cloud@alibaba_cloud在Flink Forward Asia Shenzhen 2026上,NVIDIA的Chuan Chen介绍了与阿里云的技术合作。双方通过CUDA库加速Apache Flink的多模态数据流处理。这一开源协作实现了端到端高性能多模态流式架构,适用于AI评论、实时图文流和交互式问答。行业NVIDIAAlibaba CloudApache Flink7 个信源在谈事件专题推荐理由:NVIDIA和阿里云用CUDA把Flink的多模态数据处理速度拉满了,想做实时AI评论或图文问答的可以看看这个架构。原文稍后读已读值得跟进有用关注 NVIDIA
00:48berryxia@berryxiaMLX维护者、Electron.js创始人@zcbenz在Apple宣布,MLX的CUDA后端所有测试全部通过。这意味着原本仅限苹果硅芯片的机器学习框架MLX,现在也能在NVIDIA显卡上高效运行。同一套代码在Mac和NVIDIA GPU上都能流畅执行,打破了PyTorch的兼容瓶颈。此举标志着本地AI跨平台时代加速到来,开发者不再受限于单一硬件生态。AI产品MLXCUDA跨平台推荐理由:MLX打通CUDA后,做本地AI推理的开发者终于可以一套代码跑通Mac和NVIDIA显卡,省去PyTorch兼容折腾,建议关注这个框架的跨平台潜力。原文稍后读已读值得跟进有用关注 MLX