英伟达发布 Audex 统一模型:30B 总参数,避免多模态扩展后文本能力下滑

英伟达发布 Audex 统一模型:30B 总参数,避免多模态扩展后文本能力下滑问题

精选理由

英伟达出了个Audex,30B参数但只激活3B,能听能说还不掉文本能力,MMLU-Redux得分86.4比原来还高一点。

AI 摘要

英伟达于6月发布Audex(Nemotron-Labs-Audex-30B-A3B)统一音频-文本大模型,总参数量30B,激活参数3B。该模型以Nemotron-Cascade-2-30B-A3B为骨干,采用52层混合Mamba-Transformer结构,128个可路由专家。音频编码使用AF-Whisper,语音输出用X-Codec2,非语音音频用X-Codec。文本评测中,Audex在MMLU-Redux上得分86.4(高于骨干86.3),在IMO AnswerBench上81.1(高于79.3),但在MMLU-Pro和GPQA-Diamond上小幅下降。

原文 · IT之家

英伟达发布 Audex 统一模型:30B 总参数,避免多模态扩展后文本能力下滑问题

IT之家 7 月 8 日消息,英伟达于今年 6 月发表论文,推出 Audex(Nemotron-Labs-Audex-30B-A3B)统一音频-文本大语言模型,总参数量 30B, 激活参数 3B,在保留核心文本智能情况下,能理解和生成音频(audio)和语音(speech)。 该模型骨干为文本模型 Nemotron-Cascade-2-30B-A3B,后者为 52 层混合 Mamba-Transformer 结构,包含 128 个可路由专家、每次激活 6 个专家。 该模型的设计目标是避免多模态扩展后文本能力下滑问题。论文显示,Audex 将音频输入编码后映射到文本嵌入空间,并把量化后的音频输出标记与文本标记统一处理。 在音频组件上,Audex 使用 AF-Whisper(音频编码器)处理 16kHz 输入,配合两层 MLP 适配器映射特征,输出词表从原始 131072 个 Token 扩展至 205312 个 Tokens。 语音输出采用 X-Codec2(语音编解码器),速率为每秒 50 个标记,使用单层 finite scalar quantization(有限标量量化),码本大小为 65536。非语音音频采用 X-Codec(音频编解码器),速率为每秒 200 个标记,使用 4 层展平残差向量量化。 文本评测方面,Audex 在 MMLU-Redux 上得分 86.4,高于骨干模型的 86.3;在 IMO AnswerBench 上为 81.1,高于骨干的 79.3,但在 MMLU-Pro 与 GPQA-Diamond 上出现小幅下降。 IT之家附上参考地址 Unified Audio Intelligence Without Regressing on Text Intelligence