Fermion开源语音识别模型Phonon-2
精选理由
Fermion的Phonon-2模型能在普通笔记本上极速转写长音频,无需高端显卡。
Fermion发布开源语音识别模型Phonon-2,体积仅164MB。在普通轻薄笔记本上转写1小时音频只需约20秒。通过极低位宽权重压缩技术大幅缩减体积,识别准确率对齐体积大15倍的原版大模型。
原文 · Gorden Sun
Fermion开源语音识别模型Phonon-2:极速转写长音频
仅164MB,在普通轻薄笔记本上转写1小时音频只需约20秒。通过极低位宽权重压缩技术大幅缩减体积,识别准确率却对齐了体积大其15倍的原版大模型,在会议和演讲场景下的准确表现甚至更优。
这意味着个人电脑无需依赖昂贵的高端显卡,就能低成本在本地流畅运行高精度的语音听写与音频转写。
仅支持英文。
模型:https://t.co/2GswmfHYp8