20:49官方账号Decoder@Jonathan KemperNvidia正在开发开源权重模型Nemotron 4,目标参数规模达一万亿,旨在与全球最佳免费模型竞争。然而,中国实验室如DeepSeek和Qwen已在更大规模上取得进展。Nemotron 4的发布将加剧开源模型领域的竞争。AI模型Nemotron 4Nvidia万亿参数10 个信源在谈事件专题推荐理由:Nvidia要出万亿参数开源模型了,但中国实验室已经跑在前面,看看这场竞赛怎么打。原文稍后读已读值得跟进有用关注 Nemotron 4
22:58IT之家(博客/媒体)72°英伟达正在研发新一代开源 AI 模型系列 Nemotron 4,据 The Information 援引项目参与者消息,其中最大模型预计至少拥有 1 万亿个参数。英伟达生成式 AI 副总裁 Kari Briski 表示,投资 Nemotron 是为了让每家企业、每个国家都能获得前沿开源模型。该模型最早可能在今年秋末准备就绪,但发布日期尚未确定。英伟达还发布了 Nemotron 3.5 Lightning 模型,面向代码审查、工具调用等任务,并推出开源模型路由库 NeMo Switchyard。AI模型Nemotron英伟达开源模型推荐理由:英伟达要出万亿参数开源模型了,直接对标全球顶级,想了解开源模型新格局的可以看看。原文稍后读已读值得跟进有用关注 Nemotron
17:21AI Will@FinanceYF575°34岁创始人杨植麟,清华本科+CMU博士,曾任职Meta AI和Google Brain。其博士论文工作XLNet累计被引超1万次,该技术脉络演进为Kimi K2模型的万亿参数MoE架构。这一技术路线被认为是Kimi在与美国模型竞争中获胜的关键因素之一。AI模型Kimi杨植麟XLNet1 个信源在谈事件专题推荐理由:想知道Kimi K2的MoE架构从哪来的?原来源于创始人十年前的博士论文XLNet,技术传承很有意思。原文稍后读已读值得跟进有用关注 Kimi
10:02官方一手pandaily@contact@pandaily.com (Pandaily)76°阿里巴巴发布 Qwen3.8-Max,参数量达 2.4 万亿,采用开源许可。官方称其性能仅次于 Fable 5。该模型是近一个月内四个中国实验室发布的万亿参数开源模型之一。AI模型Qwen3.8阿里巴巴开源模型8 个信源在谈事件专题推荐理由:阿里把 2.4 万亿参数的 Qwen3.8-Max 开源了,说只比 Fable 5 弱一点。国产开源模型卷到万亿级别了。原文稍后读已读值得跟进有用关注 Qwen3.8
17:09官方一手歸藏(guizang.ai)@op741878°MiMo 推出 V2.5 Pro UltraSpeed 模型,实现每秒输出超过 1000 Token,成为全球首个达到此速度的万亿参数模型。实测中,复杂 3D 游戏生成峰值达 1426 Token/s,32 秒输出 25624 Token。该模型在保持高推理速度的同时,未出现能力下降,适合 Agent 和并发场景。藏师傅的测试显示,其首次响应时间低至 0.83 秒,代码生成质量高。目前面向 To B 客户,成本有待优化。AI模型MiMo超高速模型万亿参数推荐理由:万亿参数模型跑出 1000+ Token/s 的速度,做 Agent 和实时交互的开发者可以直接体验,效率提升肉眼可见。原文稍后读已读值得跟进有用关注 MiMo
15:39官方一手pandaily@contact@pandaily.com (Pandaily)精选76°Sphere AI Lab 开源了 Orbit,一个强化学习后训练框架,支持在单个 8×B200 节点上对万亿参数模型(如 DeepSeek-V4)进行微调。该框架通过优化内存和计算效率,大幅降低了大规模模型训练的门槛,使得资源有限的团队也能进行高效的后训练。Orbit 的发布解决了万亿参数模型训练需要大规模集群的痛点,有望推动更多研究者和开发者参与大模型的后训练优化。AI模型开源/仓库强化学习后训练推荐理由:Orbit 让万亿参数模型的后训练不再依赖大规模集群,做 RL 微调或大模型优化的团队可以直接在单节点上跑 DeepSeek-V4,建议试试这个开源方案。原文稍后读已读值得跟进有用关注 开源/仓库