精选理由
SpeechEQ搞了个新基准,测AI在对话里能不能听懂语气和情绪,发现模型靠文字猜情绪,安全对齐后还变傻了。想做真情感AI的必看。
现有机器情感智力评估局限于孤立文本或被动声学感知,忽略多轮对话中的跨模态推理。新框架SpeechEQ基于EQ-i 2.0理论构建了2265个对话数据集,覆盖15个EQ子量表,并引入多轮评估协议和SEQ分数。实验发现端到端语音语言模型优于级联系统,但仍存在文本依赖的“模态捷径”、对齐引发的“安全陷阱”和“上下文失忆”三大瓶颈。
AI 翻译 · 中文
现有机器情感智力评估局限于孤立文本或被动声学感知,忽略多轮对话中的跨模态推理。新框架SpeechEQ基于EQ-i 2.0理论构建了2265个对话数据集,覆盖15个EQ子量表,并引入多轮评估协议和SEQ分数。实验发现端到端语音语言模型优于级联系统,但仍存在文本依赖的“模态捷径”、对齐引发的“安全陷阱”和“上下文失忆”三大瓶颈。
As multimodal conversational systems increasingly engage in spoken interaction, their ability to navigate paralinguistic social cues has become a critical bottleneck for natural human-AI communication. However, existing …