17:06Geek@geekbb精选Perplexity AI 开源了一个名为 w? 的基准测试,专门衡量 AI 智能体在广域深度研究任务中的表现。该测试涵盖大规模信息发现、信息富集、抽取、实体消歧和证据合成五个关键能力。基准通过多步骤任务模拟真实研究场景,要求模型在开放域中整合分散信息。Perplexity AI 表示该基准旨在推动更可靠的知识工作自动化。AI模型Perplexity AI基准测试信息检索推荐理由:Perplexity AI 刚发布一个专门测深度研究能力的基准,想试试你家智能体能不能像人类一样做信息拼图?原文稍后读已读值得跟进有用关注 Perplexity AI