9月1日
07:48
07:48官方一手marktechpost@Asif Razzaq
Keenable AI 开源了 NEEDLE 基准测试工具,每小时重建一次查询集。该基准专门解决搜索 API 读取答案键的问题。测试对象包括具有获取工具的搜索智能体。基准测试防止模型直接下载公共数据集跳过检索过程。
推荐理由:Keenable AI 发布了 NEEDLE 基准,每小时更新查询集,防止搜索模型作弊跳过检索步骤。
8月15日
01:43
01:43Aravind Srinivas@AravSrinivas
72°
Perplexity与OpenRouter联合推出了Web Search Benchmarks。该基准在openrouter.ai/benchmarks上公开,比较不同模型和配置下的搜索工具表现。Web Search Benchmarks的排名能帮助开发者决定如何为智能体(agent)配置搜索grounding。

推荐理由:Perplexity和OpenRouter发布了搜索基准,直接比较不同模型配搜索工具的效果,帮你决定智能体怎么接入搜索。