主要来源arXiv cs.LG
查看原文事件专题 ·单一信源
SepRQ 开源:无掩码多尺度语音分离 SSL 框架
SepRQ 是一个开源的自监督语音表征学习框架,用冻结随机投影码本上的伪源分离目标替代掩码预测。在 SUPERB 基准上,SepRQ 在说话人日志和语音分离任务中超过 WavLM 等模型,Base 和 Large 规模均领先,推理参数仅 85.68M。它在 DIHARD 3 多域说话人日志数据集和目标说话人 ASR 任务上表现稳定,并在三说话人混合语音 WSJ0-3Mix 上展示了当前 SSL 文献难以企及的分离能力。目前同类 cocktail-party SSL 只有 C-HuBERT 和 SA-WavLM,且均为闭源。
当前结论
做语音分离或说话人日志的可以看看,SepRQ 开源了,参数才 85.68M 却在 SUPERB 上超过 WavLM,还支持三人混合语音分离。
2 个信源36° AI 热度最后更新 2026/10/3 18:05:45
证据链
2 个信源相关来源 1Apple ML Research
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。