09:25官方账号arXiv cs.LG@Jieying Xue, Phuong Minh Nguyen, Minh Le Nguyen, Shogo Okada精选73°该研究探索了功能向量(FVs)在多语言多标签情感识别任务中的跨语言迁移能力。研究显示,从源语言提取的功能向量能在零样本设置中显著提升目标语言性能,无需推理时提供演示。每个大语言模型在构建有效功能向量时表现出相对稳定的最佳注意力头范围,且这一模式在不同语言中保持一致。论文功能向量情感识别跨语言推荐理由:论文发现功能向量能跨语言传递任务信号,无需演示即可提升多语言情感识别性能,比少样本学习更高效。原文稍后读已读值得跟进有用关注 功能向量
09:19官方账号arXiv cs.AI@Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge论文针对多模态情感识别(MER)中大模型(如7B参数)推理慢、难以部署的问题,提出轻量级框架Light-MER,模型参数小于1B。通过知识蒸馏将大教师模型的知识迁移至学生模型,引入两种优化策略:基于Sliced Wasserstein距离与隐藏状态对齐的最优传输损失,以及基于GRPO的多奖励优化以平衡性能与效率。在9个基准数据集上,Light-MER取得SOTA性能,同时推理速度显著提升。代码已在GitHub开源。论文Light-MER知识蒸馏多模态推荐理由:他们挑战了多模态情感模型必须大的假设,用知识蒸馏搞出<1B的Light-MER,9个基准超了大模型还更快,做部署的可以看看。原文稍后读已读值得跟进有用关注 Light-MER
12:28官方账号arXiv cs.AI@Sathvik Manikantan Napa Ugandhar, Hao Zhang, Alison Gunzler, Yuzhe Wang, Thomas Thebaud, Georgi Tinchev, Venkatesh Ravichandran, Laureano Moro-Velázquez论文提出DyadEE数据集,包含真实情感协调对话和通过交换伴侣、情感重合成制造的干扰对话。同时提出TRACE框架,将双人交互建模为基于情感微调Whisper声学嵌入的有序序列,将每个样本视为交互痕迹而非池化话语。在DyadEE上实验表明,融入对话上下文和关系信息可提升检测效果,TRACE达到97.01%的准确率。论文TRACEDyadEEWhisper推荐理由:想研究语音AI如何感知对话中的情感协调?这篇论文提出了新数据集DyadEE和框架TRACE,准确率高达97%,值得做语音交互的朋友看看。原文稍后读已读值得跟进有用关注 TRACE
12:44官方一手arXiv: OpenAI@Martijn Bartelds, Federico Bianchi, James Zou该项研究评估了四个主流实时语音系统——OpenAI GPT Realtime 2、Google Gemini 3.1 Flash Live、Alibaba Qwen3.5 Omni Plus和Omni Flash——在三个需要理解语音语调的场景中的表现。面对哭泣的呼叫者说“没事”、恐惧语气下达的电汇指令、以及明显讽刺的同意,所有系统都依据文字而非语调执行操作。其中三个系统在直接询问时能准确识别悲伤、恐惧或讽刺,但在决策任务中又忽略这些信息。研究还发现系统估计口音和年龄时同样跟随文字偏见而非声学特征。提示词引导仅能部分且不稳定地改善表现。论文GPT Realtime 2Gemini 3.1Qwen3.5 Omni10 个信源在谈事件专题推荐理由:这篇论文测试了四个主流实时语音AI处理哭泣、恐惧、讽刺时的表现,结果它们能听出情绪却不当回事,甚至误判口音和年龄。用语音AI处理敏感场景要小心。原文稍后读已读值得跟进有用关注 GPT Realtime 2