06:41官方账号Perplexity@perplexity_aiDeepSeek V4 Pro 现已在美国托管的 Perplexity Computer 中可用。Perplexity 在 WANDR 基准上对其进行了评估,得分为 0.359,每任务成本 0.75 美元。该模型比成本性能前沿上的下一个模型便宜 62%。AI产品DeepSeek V4 ProPerplexityWANDR1 个信源在谈事件专题推荐理由:Perplexity 把 DeepSeek V4 Pro 放进自家电脑了,跑分 0.359,每任务才 0.75 美元,比同档便宜六成多,性价比很能打。原文稍后读已读值得跟进有用关注 DeepSeek V4 Pro
02:57官方账号Perplexity@perplexity_aiGrok 4.6 已在 Perplexity 和 Perplexity Computer 上线。该模型在 WANDR 基准上位于性能和效率的帕累托前沿。相比 Fable 5,Grok 4.6 在结果持平的情况下成本降低超过 60%。用户现在即可在 Perplexity 生态中直接使用 Grok 4.6。AI模型Grok 4.6PerplexityWANDR6 个信源在谈事件专题推荐理由:Grok 4.6 上线 Perplexity 了,在 WANDR 上跟 Fable 5 结果持平,成本还低 60% 以上。原文稍后读已读值得跟进有用关注 Grok 4.6
06:45官方账号Perplexity@perplexity_ai72°Claude Opus 5 现已在 Perplexity 和 Perplexity Computer 上可用。Perplexity 将其与另外六个模型在 WANDR 基准上进行了评估。Claude Opus 5 表现优于除 Fable 5 外的所有模型,同时成本比这些模型平均低 57%。AI模型Claude Opus 5PerplexityWANDR10 个信源在谈事件专题推荐理由:Perplexity 上了 Claude Opus 5,WANDR 跑分只输 Fable 5,价格还便宜一半多,可以试试。原文稍后读已读值得跟进有用关注 Claude Opus 5
15:25官方一手marktechpost@Asif Razzaq精选Perplexity AI 发布了开放基准 WANDR,包含500个证据密集型任务,用于评估研究智能体在搜索广度和深度上的表现。该基准测试智能体能否发现多个符合条件的实体,并为每个实体提供可验证的引用证据。当前 Perplexity Search as Code 以 soft F1 0.363 和 hard F1 0.133 的成绩领先。AI模型Perplexity AIWANDRSearch as Code推荐理由:想测你的研究智能体能不能又广又深地搜证据?Perplexity 新出 WANDR 基准,500个任务等着,看看 Search as Code 怎么跑到了0.36 F1。原文稍后读已读值得跟进有用关注 Perplexity AI
09:48Aravind Srinivas@AravSrinivas精选Perplexity 宣布 Wide Research 功能现已在 Perplexity Agent API 中可用。该功能旨在解决窄搜索(Narrow search)后的前沿问题,即大规模查找所有合格结果并逐个提供证据。Perplexity 同步发布 WANDR,一个包含 500 个真实知识工作任务的基准,即便是当前最强模型也难以胜任。Agent API 的 Search as Code 架构允许模型一次性设计研究策略,然后确定性执行,避免上下文过载。开发者可通过 wide-research preset 在 Agent API 中启用该功能。AI产品Perplexity Agent APIWide ResearchWANDR推荐理由:Perplexity 把搜索从单点命中升级成全面取证,还自建了 500 个真实任务的硬基准 WANDR,做研究自动化的话值得试试这个 preset。原文稍后读已读值得跟进有用关注 Perplexity Agent API
09:09Suhail@SuhailPerplexity 开源了内部基准测试 WANDR,用于评估深度与广度研究能力。WANDR 在对比所有 Deep Research 类基准中表现最强,例如比 DRACO 更优秀。该基准测试已公开在 research.perplexity.ai/articles/wandr。AI模型PerplexityWANDR基准测试推荐理由:Perplexity 拿他们最强的内部测试 WANDR 开源了,专门测深度研究能力,比市面其他基准都强。原文稍后读已读值得跟进有用关注 Perplexity
04:03Aravind Srinivas@AravSrinivasPerplexity宣布开源其内部用于衡量AI研究能力的基准WANDR。该基准在构建Perplexity Computer的深度研究功能中起到关键作用。公司表示WANDR在成本和性能上均达到最佳效果。Perplexity强调强大的内部评估和基准是其主要优势之一。AI模型PerplexityWANDR开源基准推荐理由:Perplexity把内部跑得最好的研究能力基准WANDR开源了,你要评测推理模型可以拿来用。原文稍后读已读值得跟进有用关注 Perplexity
04:01官方账号Perplexity@perplexity_ai精选Perplexity AI 宣布开源其内部基准测试 WANDR,该基准用于评估计算机在深度与广度研究能力上的表现。WANDR 最初是为构建 Perplexity Computer 而开发的。开源后,开发者可利用此基准测试自己的模型或系统。目前该基准已发布在 research.perplexity.ai 上。AI模型Perplexity AIWANDR开源推荐理由:Perplexity AI 把他们自己用来测试 AI 研究深度的工具 WANDR 开源了,想测测自家模型的研究能力可以用它。原文稍后读已读值得跟进有用关注 Perplexity AI
03:58官方账号Perplexity@perplexity_ai精选WANDR是一个评测基准,用于测试智能体发现大规模实体集并验证每个实体特定事实的能力。该基准提供密集且可解释的评估信号,能揭示智能体在哪个环节失败。其流程还可作为半自动训练数据工厂。由Perplexity AI发布。论文WANDRPerplexity AI智能体推荐理由:Perplexity AI搞了个新评测WANDR,专门看智能体能不能找到一堆实体并核实每个的具体信息,比单一评分更清楚哪里不行。原文稍后读已读值得跟进有用关注 WANDR
03:56官方账号Perplexity@perplexity_aiWANDR不再使用预定义的黄金解决方案来评分,而是动态重新抓取每个引用的页面。它逐条核对每个声明与引证证据的一致性。这种方法适用于需要处理随时间变化事实的任务。AI模型WANDRPerplexity AI事实验证推荐理由:Perplexity AI 搞了个新评估方式 WANDR,不用固定答案打分,而是实时对证据,适合处理时效性事实。原文稍后读已读值得跟进有用关注 WANDR
11:23Aravind Srinivas@AravSrinivasPerplexity 为 Enterprise 组织启用了 Grok 4.5 模型。面向 Consumer Pro 和 Max 订阅用户,Grok 4.5 可作为计算机编排模型。在 WANDR 基准上,Grok 4.5 得分高于其他五种编排配置。其成本约为 Opus 4.8 的一半。AI模型Grok 4.5PerplexityOpus 4.83 个信源在谈事件专题推荐理由:Perplexity 现在能用 Grok 4.5 做编排了,比 Opus 4.8 便宜一半,性能还更强,Pro 和 Max 用户快去试试。原文稍后读已读值得跟进有用关注 Grok 4.5
07:14官方账号Perplexity@perplexity_ai精选Perplexity 宣布 Grok 4.5 作为 Computer 的编排模型,面向 Pro 和 Max 订阅用户可用。在 WANDR 基准上,Grok 4.5 的得分高于五个其他编排配置。其成本约为 Opus 4.8 的一半。该更新旨在提升 AI 电脑的自动化任务能力。AI产品Grok 4.5PerplexityComputer推荐理由:Perplexity 给 Pro 和 Max 用户升级了 Grok 4.5 做编排模型,在 WANDR 上比 Opus 4.8 便宜一半还得分更高,值得试试。原文稍后读已读值得跟进有用关注 Grok 4.5
04:40Aravind Srinivas@AravSrinivas精选Perplexity CEO Arav Srinivas透露,SpaceXAI的Grok 4.5在内部代理研究基准WANDR上获得最高分。该模型作为orchestrator集成到Perplexity Computer中,价格仅为Claude Opus 4.8(高)的一半。Grok 4.5还以相近成本超越了Perplexity当前GLM 5.2后训练模型的表现。该模型现已面向Consumer Pro和Max订阅用户提供。AI模型Grok 4.5Claude Opus 4.8Perplexity推荐理由:Perplexity把Grok 4.5作为Computer的编排模型,代理研究任务得分最高,价格只有Opus 4.8的一半,值得试。原文稍后读已读值得跟进有用关注 Grok 4.5