模型精选73°

ESPnet发布YODAS v3语音数据集

精选理由

ESPnet开源了110万小时多语言语音数据集,覆盖100多种语言,带时间戳和翻译,直接拿来训练语音模型。

ESPnet团队发布了YODAS v3语音数据集,包含超过110万小时的多语言网络音频,覆盖100多种语言。数据集提供句子和单词级别的时间戳字幕,大部分非英语内容配有英文翻译。数据集还标注了实际有效的音频采样率与声道信息,为语音识别、语音合成和音频表征模型训练提供高质量基准。

图片来源 · Gorden Sun
原文 · Gorden Sun

ESPnet发布YODAS v3语音数据集:大幅降低多语言语音AI的训练门槛

这个大规模开源数据集包含超过110万小时的多语言网络音频,覆盖了100多种语言。不仅提供句子和单词级别的时间戳字幕,还为大部分非英语内容配备了英文翻译,甚至标注了实际有效的音频采样率与声道信息。对于想要训练语音识别、语音合成或音频表征模型的研究者来说,可以直接获取规整、无版权问题、高质量、多语言的基准数据。

数据集:https://t.co/pcbTLKRWI5