17:53官方账号arXiv cs.LG@Junyi Ye, Gargi Vijay Borde本文提出RG-ResMoE架构,用于1027只美国股票的5天已实现波动率预测。该模型将制度信息仅用于专家路由,而非直接参与预测。在容量匹配实验中,RG-ResMoE在预测准确性和训练稳定性上优于标准MLP,并在日本股票面板上复现了类似增益。将制度变量直接拼接到输入会降低性能,而仅作为路由门控输入则改善预测精度和VaR校准。软路由一致优于硬路由。论文RG-ResMoE混合专家波动率预测推荐理由:金融时序预测别急着堆参数,试试把市场状态信息只用来做路由。RG-ResMoE在1027只美股上比MLP更准更稳,软路由还改善了VaR校准。原文稍后读已读值得跟进有用关注 RG-ResMoE
14:26IT之家(博客/媒体)精选DeepGrove 发布轻量模型 Maple-Preview-20B-A1B,采用混合专家架构,总参数量 202 亿,激活参数量 14.9 亿。官方称在 iPhone 上运行速度达 127 tokens/s,是 Bonsai 27B(9.6 tokens/s)的约 13 倍。该模型使用三值权重方案,将权重约束为 {-1,0,1},包含 24 层、256 个专家(8 个活跃)。在 MacBook Pro(M5 Pro)上完成 IMO 2024 P1,结果为 7/7,运行速度 281.5 tokens/s。处理 131,000 tokens 上下文时,内存占用约 7.69GB。AI模型Maple-PreviewDeepGrove三值权重推荐理由:DeepGrove 新模型 iPhone 上跑 127 tokens/s,比 Bonsai 27B 快约 13 倍,亮点是三值权重方案。原文稍后读已读值得跟进有用关注 Maple-Preview
01:31官方账号Cursor@cursor_aiCursor在官方博客发布了关于混合专家(MoE)模型的构建详解。文章具体介绍了专家路由、负载均衡等关键组件的实现思路。其目标是让更多实验室能够高效训练自己的MoE模型,降低AI研究门槛。技巧Cursor混合专家模型训练推荐理由:Cursor把自己做MoE模型的流程写成了博客,想自己训练混合专家模型的小团队可以直接照着搞。原文稍后读已读值得跟进有用关注 Cursor
15:38IT之家(博客/媒体)Thinking Machines Lab发布Inkling-Small,总参数276B、激活参数12B,规模约为Inkling的四分之一。该模型采用MoE架构,支持音频和图像原生推理、最高1M token上下文。在Humanity's Last Exam基准中,Inkling-Small得分31.6%,高于Inkling的29.7%。模型完整权重已开放,并接入Tinker微调服务。AI模型Inkling-SmallThinking Machines Lab开源模型3 个信源在谈事件专题推荐理由:Inkling-Small四分之一参数就能接近甚至超过原版,权重开源,还能微调,快去玩。原文稍后读已读值得跟进有用关注 Inkling-Small
16:07IT之家(博客/媒体)AMD于7月24日发布Instella-MoE系列模型,总参数量16B,激活参数量2.8B。该系列包含6个版本:预训练、Mid-training、长上下文、SFT、DPO、RL。性能上,Base版本低于Qwen3.5-4B-Base,但Think版本在2.8B激活参数下超越Gemma-4-E4B-it。模型在AMD Instinct MI300X和MI325X GPU上训练,基于ROCm软件栈及Primus训练和Miles RL框架。预训练速度通过FarSkip-Collective提升12.7%,推理TTFT缩短最多39.2%。AI模型Instella-MoEAMD开源模型推荐理由:AMD开源了自家GPU训的Instella MoE,Think版参数少但强过Gemma-4,值得看。原文稍后读已读值得跟进有用关注 Instella-MoE
11:15官方账号arXiv cs.LG@Bertram Taetz, Hugo Albuquerque Cosme da Silva, Gabriele Bleser-Taetz本研究提出基于冻结大语言模型和LoRA变体的持续学习方法,使运动-语言智能体能在不遗忘旧知识的情况下增量学习新动作概念。采用混合专家架构和基于自编码器的路由器在推理时选择任务特定专家,无需任务标签。在从HumanML3D导出的5任务基准上,该方法在运动到文本(M2T)和文本到运动(T2M)两个方向上实现了近乎零遗忘,且保持高质量生成与描述。实验表明硬专家选择在质量指标上显著优于软专家混合,专家隔离对持续学习性能至关重要。论文运动-语言智能体持续学习LoRA推荐理由:这篇论文提出用LoRA和混合专家架构让智能体不断学新动作而不忘旧的,5任务基准上几乎零遗忘,值得做持续学习或运动生成的看看。原文稍后读已读值得跟进有用关注 运动-语言智能体