Perplexity AI 发布 WANDR 基准:评估研究智能体的搜索广度与深度
想测你的研究智能体能不能又广又深地搜证据?Perplexity 新出 WANDR 基准,500个任务等着,看看 Search as Code 怎么跑到了0.36 F1。
想测你的研究智能体能不能又广又深地搜证据?Perplexity 新出 WANDR 基准,500个任务等着,看看 Search as Code 怎么跑到了0.36 F1。
Perplexity 用代码驱动搜索的方式解决了传统深度研究效率低、泛化差的问题,做信息检索或研究分析的团队值得关注这一新范式。
Perplexity 把搜索从“聊天”变成了“编程”,做研究、数据采集或竞品分析的团队可以大幅减少手动操作,值得一试。