论文Agent 与开发者10:50SCB基准测试评估语音多轮推理能力SCB团队用103个数学问题测试了语音系统多轮推理能力,LEGO表现优于GPT-4o Realtime。#SpeechConversationBench#GSM8K#LEGO#GPT-4oaarXiv cs.AI@Kanpat Vesessook, Saksorn Ruangtanusak原文稍后读已读值得跟进有用关注 SpeechConversationBench