8月22日
01:33
8月18日
06:15
06:15官方账号LangChain@LangChainAI
LangChain 将举办一场网络研讨会,主题聚焦语音智能体的评估。会上演示如何从执行、结果、体验三个维度进行评测。同时讲解如何为生产环境中的语音智能体构建更完整的评估体系。参会报名通过 events.langchain.com 页面完成。

推荐理由:LangChain 有个线上研讨会,教你怎么从执行、结果和体验三个角度评估语音智能体,做语音产品的朋友值得看看。
8月11日
22:10
22:10官方账号LangChain@LangChainAI
LangChain 宣布举办一场关于语音智能体评估的网络研讨会。研讨会将涵盖执行、结果和体验三个维度,包括工具使用、任务完成、延迟、中断和对话摩擦等评估指标。活动详情可在 events.langchain.com 查看。

推荐理由:做语音智能体的朋友可以看看,LangChain 这场会讲怎么从执行、结果到体验全面评估,比单看任务完成率更实用。
8月3日
7月22日
6月29日
5月21日
07:59
07:59官方账号ElevenLabs@elevenlabsio
ElevenLabs 宣布将阿尔伯特·爱因斯坦的语音引入平台,并推出一个基于其书面档案的智能体,能够以爱因斯坦标志性的声音进行互动。这一功能将语音智能体应用于教育领域,让用户能够与历史人物进行对话式学习,为知识传递带来全新维度。该智能体目前已在 ElevenLabs 上线,支持语音交互。
推荐理由:做教育科技或语音交互的团队值得关注——ElevenLabs 把历史人物语音化,让学习从单向阅读变成双向对话,直接可用的场景比想象中多。
5月14日
13:26
13:26官方账号arXiv cs.LG@Tara Bogavelli, Gabrielle Gauthier Melançon, Katrina Stankiewicz, Oluwanifemi Bamgbose, Fanny Riols, Hoang H. Nguyen, Raghav Mehndiratta, Lindsay Devon Brin, Joseph Marinier, Hari Subramani, Anil Madamala, Sridhar Krishna Nemala, Srinivas Sunkara
精选
EVA-Bench 是一个全新的端到端评估框架,专门用于测试语音智能体(Voice Agents)在真实对话场景中的表现。它解决了现有基准无法同时模拟动态对话和全面衡量语音特有失败模式的问题。框架包含 213 个企业级场景,并引入两个复合指标:EVA-A(准确性)和 EVA-X(体验),分别评估任务完成度、忠实度、语音保真度以及对话流畅性、简洁性和轮次时机。在 12 个系统上的测试显示,没有系统能同时在两个指标上超过 0.5,且峰值性能与可靠性能差距显著。该框架已开源,为语音智能体的标准化评估提供了新工具。
推荐理由:做语音智能体或对话系统的团队终于有了一个能同时测准确性和体验感的基准——EVA-Bench 覆盖了企业场景和噪声鲁棒性,直接帮你对比不同架构的优劣,建议点开看看具体指标设计。
01:10
01:10官方账号Noam Shazeer@NoamShazeer
Google 发布了 Gemini 3.1 Flash Live 模型,专为生产级可靠性设计。该模型在复杂函数调用和长时推理基准测试中领先,支持多语言,已用于搜索直播功能。开发者可借此构建可扩展的语音优先智能体,完成复杂任务。
推荐理由:语音智能体开发者终于有了一个生产级模型——Gemini 3.1 Flash Live 在复杂函数调用和长时推理上表现领先,做语音交互的团队可以直接上手试试。