模型精选73°

蚂蚁开源声纹验证模型 AntSpeaker/MECT,9.57M 参数支持 100ms 实时推理

精选理由

蚂蚁开源了个 9.57M 参数的小声纹模型,100ms 延迟就能实时验证身份,银行核身、端侧解锁直接能用,小模型打大模型这点挺有意思。

蚂蚁集团开源了声纹验证模型 AntSpeaker/MECT,把 MoE 架构引入全监督声纹训练。该模型只有 9.57M 参数,在 VoxCeleb1 上追平并在平均指标上反超了 5.87 亿参数预训练模型的水平。通过因果重训练,它在 100ms 低延迟下仍能保持接近离线精度的声纹特征提取。典型落地场景包括银行和客服热线的电话核身、App 登录以及端侧设备解锁。

原文 · AIGCLINK

语音模型这两天扎堆儿出,蚂蚁刚刚开源了一套声纹验证模型:AntSpeaker/MECT,超小、能实时跑

可低延时声纹流式推理,在100ms的低延迟下能保持高精度声纹特征提取

有几个典型使用场景 银行、客服热线电话核身,比如“请说一句话验证身份” App登录、设备唤醒只认主人声音

金融核身、端侧解锁,这是最直接的落点

跟上午那个英伟达的日志模型一样,都主打小、快,一个管谁在何时说、一个管是不是同一人,都是语音管线上的专精组件

MECT是把MoE引入了全监督声纹训练,结果用9.57M的小模型,在VoxCeleb1上追平(平均指标上反超)了5.87亿参数预训练模型才能达到的水平

证明了“专家分工”这套大模型玩法,在声纹验证这种小模型全监督任务上同样奏效

其通过因果重训练,实现了100ms延迟+近离线精度,也就意味着该模型能真正用在实时场景里

#AI语音验证模型 #AntSpeakerMECT