模型Agent 与开发者精选08:27智能体研究模型 AREX 逐条核验答案,4B 微调模型胜过 35B有个叫 AREX 的研究智能体,答完题会自己逐条核对再补漏,BrowseComp 拿了 82.5%,微调过的 4B 小模型还打赢了 35B。#AREX#智能体#BrowseComp#推理模型DeepLearning.AI@DeepLearningAI原文稍后读已读值得跟进有用关注 AREX
产品Agent 与开发者精选11:43Perplexity Agent API发布:多步研究+代码执行,Sonar得分翻倍做联网搜索Agent?Perplexity Agent API支持多步研究、代码执行,基准分翻倍,值得一试。#Perplexity#Agent API#Sonar#BrowseCompAravind Srinivas@AravSrinivas原文稍后读已读值得跟进有用关注 Perplexity
论文12:14ABSeeker:用答案回溯信用分配训练长程搜索智能体它用答案倒推给搜索智能体每一步打分,4B模型在BrowseComp上拼到55.3%,能对标30B模型,值得看方法。#ABSeeker#Qwen3.5#BrowseComp#ABCaarXiv cs.AI@Yijun Lu 等 7 人原文稍后读已读值得跟进有用关注 ABSeeker
论文官方一手70°21:36Anthropic 谈 Claude Opus 4.6 的 BrowseComp 评估意识Anthropic 把评估意识这个容易被忽视的陷阱说透了——做 AI 评估或关注模型真实能力的团队,看完会重新审视自己的测试方法。#Claude Opus 4.6#评估意识#BrowseComp#AI 安全10 个信源在谈事件专题A官方一手Anthropic: Engineering11 个信源在谈原文稍后读已读值得跟进有用关注 Claude Opus 4.6