7月9日
15:00
7月8日
21:27
21:27Paul Couvert@itsPaulAi
腾讯发布开源模型Hy3,采用295B参数的MoE架构,规模仅为GLM-5.2的一半,但性能与GPT-5.5相当,且优于DeepSeek V4 Pro。该模型在同等参数量级中表现最佳,可媲美万亿级旗舰模型。Hy3提供Apache 2.0许可,免费API开放两周,适合智能体应用场景。
推荐理由:腾讯Hy3开源模型295B参数,比GLM-5.2小一半却和GPT-5.5打平,还超过DeepSeek V4 Pro,免费API两周,智能体应用很香。
10:31
10:31官方账号NVIDIA AI@NVIDIAAI
精选74°
NVIDIA 开源了 NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-NVFP4 模型,总参数量 75.3B,激活参数 9.3B,采用 MoE 架构。该模型从 Nemotron-3-Super-120B 通过 Iterative Puzzle 框架压缩而来,支持 1M token 上下文长度。模型可运行在单张 GB10 显卡上。
事件专题

推荐理由:NVIDIA 刚开源的 75B MoE 模型,实际只激活 9.3B 参数,单卡就能跑百万 token 上下文,适合长文档或代码分析。
08:54
08:54官方一手marktechpost@Asif Razzaq
NVIDIA发布了Nemotron-Labs-Audex-30B-A3B(Audex)模型,这是一个混合专家(MoE)架构,统一了音频理解、语音识别、翻译、文本转语音和音频生成五种能力。该模型以Nemotron-Cascade-2为骨干,仅在音频任务上产生边际的性能回归。Audex在30B总参数中仅有3B活跃参数,高效实现了多模态融合。
事件专题

推荐理由:NVIDIA发了款新模型Audex,能同时搞定音频理解、语音识别、翻译、TTS和音频生成,而且几乎没牺牲原有文本模型的性能。
7月7日
16:53
16:09
16:09AI Will@FinanceYF5
73°
xAI SGLang负责人在23分钟演讲中详解如何在10万张GPU上部署Grok模型。他们通过拆分Prefill与Decode阶段,将MoE专家分片到不同GPU。采用按专家路由Token的方式让通信与计算重叠执行。最终以低于DeepSeek API的定价对外提供服务。
推荐理由:想了解超大规模GPU集群如何搞推理?xAI的SGLang负责人手把手教你拆分、分片和通信重叠,还比DeepSeek API更便宜。
14:00
14:00官方一手marktechpost@Asif Razzaq
精选
腾讯Hy团队发布Hy3,一个总参数量295B的混合专家(MoE)模型,每个token仅激活21B参数。Hy3在SWE-Bench Verified上取得78.0分,报告更低的幻觉率,并支持256K上下文窗口。该模型以Apache 2.0许可证开源,可在OpenRouter上免费试用至2026年7月21日。

推荐理由:腾讯刚开源Hy3,激活21B参数就能在SWE-Bench拿到78.0,还支持256K长上下文,想尝鲜推理模型的话OpenRouter上免费到7月21日。
11:48
11:48官方一手arXiv: DeepSeek@Xiao Shi, Yingying Sun, Jiangsu Du, Zhiguang Chen, Yutong Lu
CAP框架通过协同激活驱动的专家放置减少跨设备通信,并引入通信感知剪枝选择性移除路由目标。在单节点和多节点实验中,相比DeepSeek EPLB和vLLM的序列放置,吞吐量提升1.23倍至1.86倍。该方法在达到相同加速目标时能保持更好的模型准确率。
推荐理由:这篇论文提出CAP,直接在专家放置和剪枝中考虑通信开销,实测比DeepSeek EPLB快1.2-1.8倍,适合跑大MoE模型的人。
11:21
08:39
08:39官方账号Simon Willison’s Weblog博客/媒体
73°
腾讯Hy团队发布Hy3模型,这是一个295B参数MoE架构,激活参数为21B,MTP层参数3.8B。Hy3在多项基准测试中超越同尺寸模型,并媲美2-5倍参数的开源旗舰模型。该模型支持256K上下文长度,FP8量化版本大小为300GB。目前Hy3在OpenRouter上免费开放至2026年7月21日。

推荐理由:腾讯开源了Hy3,295B MoE模型只激活21B参数,性能就能跟更大模型比。OpenRouter上免费试用到7月21日,赶紧去玩玩。
07:49
07:49Hunyuan@TXhunyuan
精选
腾讯混元推出Hy3模型,总参数量295B,采用MoE架构。该模型在同类尺寸中性能最佳,可媲美万亿参数旗舰模型。支持Apache 2.0开源协议,并提供两周免费API体验(通过OpenRouter)。适用于大多数智能体场景。

推荐理由:腾讯混元新出的Hy3,295B参数量就能比肩万亿参数的大模型,还免费给你用两周,开源随便商用,搞智能体的别错过。
6月30日
12:39
12:39官方一手arXiv: DeepSeek@Lei Bai, Zongsheng Cao, Yang Chen, Zhiyao Cui, Shangheng Du, Yue Fan, Shiyang Feng, Zijie Guo, Haonan He, Liang He, Xiaohan He, Shuyue Hu, Yusong Hu, Songtao Huang, Yichen Jiang, Hao Li, Xin Li, Dahua Lin, Weihao Lin, Fenghua Ling, Dongrui Liu, Zhuo Liu, Runmin Ma, Chunjiang Mu, Haoyang Peng, Tianshuo Peng, Jinxin Shi, Luohe Shi, Boyuan Sun, Zelin Tan, Shengji Tang, Qianyi Wang, Yiming Wu, Yi Xie, Xiangchao Yan, Jingqi Ye, Peng Ye, Fangchen Yu, Jiakang Yuan, Bihao Zhan, Bo Zhang, Chen Zhang, Shufei Zhang, Shuaiyu Zhang, Wenlong Zhang, Yiqun Zhang, Junpeng Zhao, Zhijie Zhong, Bowen Zhou, Yuhao Zhou
精选
Agents-A1是一个35B参数的Mixture-of-Experts智能体模型,通过扩展智能体视野(平均轨迹长度45K tokens)达到万亿参数级别性能。它在SEAL-0(56.4)、IFBench(80.6)、HiPhO(46.4)、FrontierScience-Olympiad(79.0)和MolBench-Bind(56.8)上超越了1T参数的Kimi-K2.6和DeepSeek-V4-pro,在SciCode(44.3)、HLE(47.6)和BrowseComp(75.5)上也具有竞争力。训练采用三阶段流程:全领域SFT、领域级教师模型、多教师领域路由在线蒸馏。
推荐理由:35B的模型干翻万亿参数?Agents-A1用长视野扩展和智能体框架做到,基准全面领先,值得看看怎么训练的。
6月26日
6月25日
10:31
10:31官方账号arXiv cs.LG@Alexander Hägele, Alejandro Hernández-Cano, Atli Kosson, Martin Jaggi
论文提出MD Decoupling优化器修改方法,将每个权重分解为超球面上的固定范数方向与可学习的每行每列幅度增益,以解耦幅度和方向的更新。该方法与Adam和Muon等基础优化器兼容,消除了对权重衰减和warmup的需求。实验表明,MD Decoupling在宽模型和大型MoE模型上均优于精心调优的基线,并允许跨模型宽度直接迁移学习率而不需重新调参。
推荐理由:这篇论文提出了一种简单通用的优化器改进方案,能解耦权重幅度和方向,消除权重衰减和warmup,在Adam和Muon上都有效,值得关注。
6月24日
6月23日
6月20日
12:57
12:57官方一手歸藏(guizang.ai)@op7418
精选71°
Noam Shazeer(Transformer论文作者之一、MoE架构提出者)加入OpenAI,负责模型架构研究。谷歌此前以27亿美元收购Character.AI换取他加入谷歌。但Shazeer在谷歌停留短暂后即转投OpenAI。
事件专题

推荐理由:Transformer论文作者Noam Shazeer,MoE提出者,跑到OpenAI研究模型架构了,谷歌27亿美元白花了?
6月19日
6月18日