09:53官方账号arXiv cs.LG@Georg Götz, Alessia Milo, Steinar Guðjónsson, Daniel Gert Nielsen, Jesper Pedersen, Finnur Pind该论文对比了不同精度的房间声学模拟方法对多通道语音增强模型的影响。作者使用SpatialNet在基于几何声学、波动声学及其混合模拟的数据集上训练,并在实测数据上评估。高保真模拟数据集训练出的模型,中位数词错误率相对降低了38%。结果表明,高保真房间声学模拟能直接提升多通道语音增强性能。论文SpatialNet多通道语音增强房间声学模拟推荐理由:这篇论文用实验告诉你,声学模拟精度越高,语音增强效果越好,SpatialNet在实测数据上词错误率降了38%,训练数据质量是关键。原文稍后读已读值得跟进有用关注 SpatialNet
12:52官方账号arXiv cs.AI@Alex Gichamba, Moise Busogi这篇论文通过控制帧率消融实验,发现神经音频编解码器在6.25 Hz处存在质量悬崖,并排除了音素冲突和码本饱和两种假设。作者指出问题源于固定训练片段时长导致解码器缺乏帧间上下文,而修正后词错误率(WER)在3.1 Hz和1.6 Hz下仍随音素负载平滑下降。研究结果表明,低帧率编解码器的推理效率增益比此前认为的更易实现。论文Neural Audio Codecs低帧率退化音素负载推荐理由:这篇论文解释了为什么音频编解码器在6.25Hz会突然变差,原来不是理论限制而是训练设置问题,修正后能降到1.6Hz依然可用。原文稍后读已读值得跟进有用关注 Neural Audio Codecs