6月12日
12:31
12:31karminski-牙医 (AI工具)@karminski3
精选
Google发布了Gemma小模型的Diffusion版本,名为Diffusion Gemma,大小26B但激活参数量仅4B。与NVIDIA合作针对RTX 4090和5090优化,5090上每秒可生成700+ token。Diffusion模型像刮奖一样逐片生成文本,速度远快于传统逐字生成模型,但输出质量略低。在AIME 2026数学测试中达到Gemma4-26B-A4B的94%水平,在Agent能力测试中达到82%。4bit量化版本仅需16G显存即可运行。
事件专题

推荐理由:Diffusion Gemma把文本生成速度拉到单卡700TPS,做实时对话或高吞吐推理的团队可以直接用,4bit量化16G显存就能跑,值得试试能否做投机解码的草稿模型。
04:04
04:04官方账号Together AI@togethercompute
精选
Trajectory Labs 在 Together Compute 和 NVIDIA 的支持下,仅用不到 24 小时就在一个开放模型上实现了前沿模型级别的性能。这展示了当优秀开源模型与合适的训练基础设施结合时,可以快速取得显著成果。Together Compute 为此提供了算力支持,凸显了开放模型生态的潜力。
事件专题

推荐理由:对于关注开源模型训练效率的团队,这个案例证明了 24 小时内就能让开放模型达到前沿水平,值得研究其训练流程。
6月11日
6月9日
6月8日
13:36
09:06
09:06IT之家博客/媒体
韩国SK电讯宣布将基于NVIDIA的AI工厂平台DSX建设AI数据中心,目标将AI云服务规模扩展至GW级别。初期采用Blackwell架构GPU,后续逐步导入Vera Rubin平台。该AI工厂计划于2027年在韩国投运,并计划扩展至整个亚洲,成为亚洲领先的AI云提供商。此外,双方还在机器人仿真和训练平台方面展开合作。
事件专题

推荐理由:SK电讯的GW级AI云计划标志着电信运营商正式切入AI基础设施赛道,对关注亚洲AI云市场、数据中心建设的从业者来说,这是一个值得跟踪的行业信号。
6月6日
08:03
08:03Aravind Srinivas@AravSrinivas
NVIDIA 最新的开源模型 Nemotron 3 Ultra 现已上线 Perplexity,面向所有 Pro 和 Max 用户开放。该模型专为长时间运行的智能体任务设计,是美国领先的开源模型之一。用户可以直接在 Perplexity 平台上体验其长上下文和推理能力。此举进一步丰富了 Perplexity 的模型选择,为开发者提供了更多开源选项。
事件专题

推荐理由:NVIDIA 的 Nemotron 3 Ultra 是专为长时智能体任务设计的开源模型,做 AI 智能体开发的团队可以直接在 Perplexity 上试用,省去本地部署的麻烦。
6月5日
00:30
00:30Fireworks AI@FireworksAI_HQ
76°
NVIDIA 的 Nemotron 3 Ultra 模型已在 Fireworks 平台上线,这是一款面向前沿推理和长时间运行自主智能体编排的开源模型。该模型专为编码智能体、深度研究和复杂企业工作流等场景设计,旨在提升 AI 在长周期任务中的自主决策与执行能力。Fireworks 提供了零日支持,开发者可立即使用。
事件专题

推荐理由:做复杂自动化智能体的团队终于有了开源推理模型的新选择——Nemotron 3 Ultra 专为长任务编排优化,编码和深度研究场景的开发者可以直接上手试。