事件专题 · 官方一手

IHBench:语音助手中断恢复基准

IHBench评估语音助手在10个企业领域中断后的恢复能力,包含6种中断类型。27个音频语言模型配置来自OpenAI、Google和开源社区。闭源模型在任务完成度上显著优于开源模型,长对话中性能下降慢约3.3倍,且无音频-文本模态差距。人类研究验证了LLM评判的可靠性,交叉分析显示恢复质量是独立能力维度。

当前结论

想测语音助手被用户打断后能不能接好活?IHBench专门看这个,比谁恢复得自然、不错步骤。闭源模型比开源稳太多了。

11 个信源42° AI 热度最后更新 2026/6/17 20:58:35

证据链

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情