07:48官方一手marktechpost@Asif RazzaqKeenable AI 开源了 NEEDLE 基准测试工具,每小时重建一次查询集。该基准专门解决搜索 API 读取答案键的问题。测试对象包括具有获取工具的搜索智能体。基准测试防止模型直接下载公共数据集跳过检索过程。论文NEEDLEKeenable AI搜索基准推荐理由:Keenable AI 发布了 NEEDLE 基准,每小时更新查询集,防止搜索模型作弊跳过检索步骤。原文稍后读已读值得跟进有用关注 NEEDLE
01:43Aravind Srinivas@AravSrinivas72°Perplexity与OpenRouter联合推出了Web Search Benchmarks。该基准在openrouter.ai/benchmarks上公开,比较不同模型和配置下的搜索工具表现。Web Search Benchmarks的排名能帮助开发者决定如何为智能体(agent)配置搜索grounding。AI模型PerplexityOpenRouter搜索基准推荐理由:Perplexity和OpenRouter发布了搜索基准,直接比较不同模型配搜索工具的效果,帮你决定智能体怎么接入搜索。原文稍后读已读值得跟进有用关注 Perplexity
23:49OpenRouter@OpenRouterAIOpenRouter发布了Web Search Benchmarks,对多种搜索工具在不同模型和配置下的表现进行排名。该基准旨在帮助开发者决定如何为AI代理配置搜索能力。排名覆盖了不同模型的搜索结果质量对比,开发者可直接参考OpenRouter官网的基准页面。AI模型OpenRouterWeb Search Benchmarks智能体推荐理由:OpenRouter出了个搜索基准,能对比不同模型接搜索的表现,帮你选agent怎么接搜索。原文稍后读已读值得跟进有用关注 OpenRouter
09:48Aravind Srinivas@AravSrinivas精选Perplexity 宣布 Wide Research 功能现已在 Perplexity Agent API 中可用。该功能旨在解决窄搜索(Narrow search)后的前沿问题,即大规模查找所有合格结果并逐个提供证据。Perplexity 同步发布 WANDR,一个包含 500 个真实知识工作任务的基准,即便是当前最强模型也难以胜任。Agent API 的 Search as Code 架构允许模型一次性设计研究策略,然后确定性执行,避免上下文过载。开发者可通过 wide-research preset 在 Agent API 中启用该功能。AI产品Perplexity Agent APIWide ResearchWANDR推荐理由:Perplexity 把搜索从单点命中升级成全面取证,还自建了 500 个真实任务的硬基准 WANDR,做研究自动化的话值得试试这个 preset。原文稍后读已读值得跟进有用关注 Perplexity Agent API