#基准测试
共 630 条 · 7 天 33 条 · 30 天 143 条
8月13日
LlamaParse 发布 ExtractBench:复杂企业文档抽取基准与 Agentic Plus
LlamaParse 发布 ExtractBench:长文档让商业模型召回崩到 35%;自家 Agentic Plus 95.6% 登顶,成本更低。
Grok 4.6 发布,LMArena WebDev 排名第7
xAI 把 Grok 4.6 放出来了,网页开发能力直接冲到 LMArena 第7,跟 GPT-5.6 和 Claude 最新版就几分之差,这代提升挺猛。
8月12日
论文18:22
DACRI:面向关键供应链的决策感知因果干预排序这篇论文用合成基准测了不同干预策略在供应链里的实际效果,LambdaMART 在某些场景确实更优,但数字基础设施上简单策略反而更强,值得做决策的人看看。
模型07:05
ExtractBench:覆盖4869页的文档提取基准发布做文档提取的可以看看,LlamaIndex搞了个大基准,测了14个模型,发现长文档上大模型掉链子,还顺带出了个便宜又准的提取工具。
8月11日
LlamaIndex 发布 ExtractBench 基准,测试复杂企业文档信息提取
LlamaIndex 搞了个提取基准,测了 14 个系统发现长文档上 VLM 会悄悄丢行,还顺带出了个便宜三倍的提取服务,搞文档处理的值得看看。
SWE-Bench ProMax:大规模多语言代码重构智能体基准
想测测你的 AI 编程助手在多语言重构上到底行不行?这个新基准 SWE-Bench ProMax 就是干这个的,比原来的 SWE-Bench 更狠。
8月10日
8月8日
Grok Imagine Image 2.0 (Low) 在图像编辑竞技场排名第二
Grok Imagine Image 2.0 (Low) 在图像编辑榜冲到第二,1439 分,比自家 Quality 版升了 5 位,值得一试。
8月7日
8月6日
8月5日
卡帕西提出 AI 测试新思路:让 Claude Opus 5 用 100 万 Tokens 构建《指环王》3D 场景
Karpathy 的新测试:让 Claude Opus 5 用 100 万 tokens 把《指环王》开头做成 3D 场景,2 小时生成了 5500 行代码。
VulcanBench实测:Qwen3.8-Max慢且贵,要准确率选Grok 4.5、要性价比选DeepSeek V4-Flash
VulcanBench 实测:Qwen3.8-Max 跑一趟 126 美元,DeepSeek V4-Flash 只要 13.6 美元,便宜 10 倍还更快。选性价比就 DeepSeek,选准确率就 Grok 4.5。
8月4日