8月19日
06:41
06:41官方账号Perplexity@perplexity_ai
DeepSeek V4 Pro 现已在美国托管的 Perplexity Computer 中可用。Perplexity 在 WANDR 基准上对其进行了评估,得分为 0.359,每任务成本 0.75 美元。该模型比成本性能前沿上的下一个模型便宜 62%。
事件专题

推荐理由:Perplexity 把 DeepSeek V4 Pro 放进自家电脑了,跑分 0.359,每任务才 0.75 美元,比同档便宜六成多,性价比很能打。
8月14日
02:57
02:57官方账号Perplexity@perplexity_ai
Grok 4.6 已在 Perplexity 和 Perplexity Computer 上线。该模型在 WANDR 基准上位于性能和效率的帕累托前沿。相比 Fable 5,Grok 4.6 在结果持平的情况下成本降低超过 60%。用户现在即可在 Perplexity 生态中直接使用 Grok 4.6。
事件专题

推荐理由:Grok 4.6 上线 Perplexity 了,在 WANDR 上跟 Fable 5 结果持平,成本还低 60% 以上。
7月25日
06:45
06:45官方账号Perplexity@perplexity_ai
72°
Claude Opus 5 现已在 Perplexity 和 Perplexity Computer 上可用。Perplexity 将其与另外六个模型在 WANDR 基准上进行了评估。Claude Opus 5 表现优于除 Fable 5 外的所有模型,同时成本比这些模型平均低 57%。
事件专题

推荐理由:Perplexity 上了 Claude Opus 5,WANDR 跑分只输 Fable 5,价格还便宜一半多,可以试试。
7月19日
15:25
15:25官方一手marktechpost@Asif Razzaq
精选
Perplexity AI 发布了开放基准 WANDR,包含500个证据密集型任务,用于评估研究智能体在搜索广度和深度上的表现。该基准测试智能体能否发现多个符合条件的实体,并为每个实体提供可验证的引用证据。当前 Perplexity Search as Code 以 soft F1 0.363 和 hard F1 0.133 的成绩领先。
推荐理由:想测你的研究智能体能不能又广又深地搜证据?Perplexity 新出 WANDR 基准,500个任务等着,看看 Search as Code 怎么跑到了0.36 F1。
7月15日
09:09
04:01
04:01官方账号Perplexity@perplexity_ai
精选
Perplexity AI 宣布开源其内部基准测试 WANDR,该基准用于评估计算机在深度与广度研究能力上的表现。WANDR 最初是为构建 Perplexity Computer 而开发的。开源后,开发者可利用此基准测试自己的模型或系统。目前该基准已发布在 research.perplexity.ai 上。
推荐理由:Perplexity AI 把他们自己用来测试 AI 研究深度的工具 WANDR 开源了,想测测自家模型的研究能力可以用它。
03:58
03:58官方账号Perplexity@perplexity_ai
精选
WANDR是一个评测基准,用于测试智能体发现大规模实体集并验证每个实体特定事实的能力。该基准提供密集且可解释的评估信号,能揭示智能体在哪个环节失败。其流程还可作为半自动训练数据工厂。由Perplexity AI发布。

推荐理由:Perplexity AI搞了个新评测WANDR,专门看智能体能不能找到一堆实体并核实每个的具体信息,比单一评分更清楚哪里不行。
03:56
03:56官方账号Perplexity@perplexity_ai
WANDR不再使用预定义的黄金解决方案来评分,而是动态重新抓取每个引用的页面。它逐条核对每个声明与引证证据的一致性。这种方法适用于需要处理随时间变化事实的任务。

推荐理由:Perplexity AI 搞了个新评估方式 WANDR,不用固定答案打分,而是实时对证据,适合处理时效性事实。
7月11日
11:23
11:23Aravind Srinivas@AravSrinivas
Perplexity 为 Enterprise 组织启用了 Grok 4.5 模型。面向 Consumer Pro 和 Max 订阅用户,Grok 4.5 可作为计算机编排模型。在 WANDR 基准上,Grok 4.5 得分高于其他五种编排配置。其成本约为 Opus 4.8 的一半。
事件专题

推荐理由:Perplexity 现在能用 Grok 4.5 做编排了,比 Opus 4.8 便宜一半,性能还更强,Pro 和 Max 用户快去试试。
07:14
07:14官方账号Perplexity@perplexity_ai
精选
Perplexity 宣布 Grok 4.5 作为 Computer 的编排模型,面向 Pro 和 Max 订阅用户可用。在 WANDR 基准上,Grok 4.5 的得分高于五个其他编排配置。其成本约为 Opus 4.8 的一半。该更新旨在提升 AI 电脑的自动化任务能力。

推荐理由:Perplexity 给 Pro 和 Max 用户升级了 Grok 4.5 做编排模型,在 WANDR 上比 Opus 4.8 便宜一半还得分更高,值得试试。