Voice Arena 发布 Monsoon 语音数据集:50 种语言、10 万小时
Monsoon 是个 10 万小时的多语言语音数据集,微调 Whisper 后孟加拉语词错率从 85% 降到 7.65%,做语音方向的可以试试 API 测测效果。
Monsoon 是个 10 万小时的多语言语音数据集,微调 Whisper 后孟加拉语词错率从 85% 降到 7.65%,做语音方向的可以试试 API 测测效果。
Hugging Face 上悄悄放了 80TB 天文数据,用你笔记本就能跑 SDSS 和 Gaia 交叉匹配。搞 AI for Science 的话别错过,比想象中好上手。
GitHub新出的多语言数据集,免费开源,里面各种语言的README和讨论都有,做多语言AI模型训练正好用上。