#基准测试
想看看哪个模型最擅长完成真实世界的复杂任务?Agent Arena用百万任务和因果追踪方法给出了答案,比普通基准更贴近实际。
Perplexity AI搞了个新评测WANDR,专门看智能体能不能找到一堆实体并核实每个的具体信息,比单一评分更清楚哪里不行。
苹果推出了MM-ToolSandBox框架,帮你测测视觉智能体到底行不行,结果很扎心:最强模型成功率不到一半,而且问题出在“看图”而不是“想事”。
想研究LLM在社交推理中的真实信念?MafiaScope用探针实验和反事实回放,让你看到智能体表面的伪装。DeepSeek案例数据很硬核。
这篇论文提出了EYT-Bench,能更真实地测出LLM在多轮对话中的意图追踪能力。用16/17模型发现推理模式大幅提升长上下文准确率,值得关注。
OpenAI的GPT-5.6 Sol在Agent Arena上冲到第二,比前代进步明显,和Claude Fable 5差距缩小了,想看看真实任务中模型表现的话值得关注。
斯坦福团队搞了个新框架,不用传统评分,用细粒度验证加logprob分布,直接刷了四个Agent基准的SOTA,还能顺便提升RL效率。
GPT-5.6 Sol 这次在编程智能体评测上确实猛,分数更高还更快更便宜,值得看看。
这篇论文拿IdeaGene-Bench测了14个LLM,最强也只有27.3%准确率,而且加谱系信息反而搞乱排名。想看看AI离真正理解科学进化还有多远?读它。
OpenAI 出了 GPT-5.6 系列,分三档定价,最贵的 Sol 编程跑分超 Claude Mythos 5,微软 Copilot 也直接用上了。想试试新模型可以看看。
OpenAI 新模型 GPT-5.6 Sol 真强,编码基准甩开 Claude Fable 5,还更快更便宜。
想选行业AI模型?Claude Fable 5 碾压全场,但成本是 DeepSeek V4 Pro 的百倍,性能只多 12 分,性价比得掂量。
Qdrant刚发了博客回应Elastic的测试,发现对方没开它的优化功能,一开就反超了:吞吐量翻倍,延迟减半,计算资源只要三分之一。想选向量数据库的可以看看。
想研究格斗游戏AI?这个新基准FootsiesGym基于极简游戏Footsies,自带高效模拟器,适合强化学习训练和对比。
想测测视觉语言模型能不能只看截图就生成可交互的网页应用?这篇论文提出了UI2App基准,发现模型在视觉还原上还行,但交互推理差得远,最高分才7.5。