ARC Prize 晒出 Grok 4.7 的实测成绩,有意思的是它一代分数涨了,二三代替反而降了,可以看看这套数据对比
#ARC-AGI
共 21 条 · 7 天 2 条 · 30 天 7 条
信息流里打上「ARC-AGI」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月7日
Grok 4.7 的 ARC-AGI 验证成绩公布:二代得分低于 Grok 4.6
10月6日
DeepSeek V4.1 Flash 在 ARC-AGI 验证集上超越 V4 Flash
DeepSeek 的 V4.1 Flash 跑分出来了,ARC-AGI-2 拿下 72.9%,比上一代高了 11.5 分,不过每任务成本贵了两倍多,看你怎么权衡。
10月2日
10月1日
9月30日
9月29日
9月7日
9月4日
8月11日
BDH-CQ以0.0007美元成本在ARC-AGI 1获29.5%
Pathway的BDH-CQ用极低成本在ARC-AGI 1拿到29.5%,靠的是潜在空间推理而不是CoT,还验证了600B参数规模,值得一看。
8月8日
8月7日
7月26日
7月14日
6月12日
6月4日
LLM智能体记忆不可靠:反复重写反而更糟
做AI智能体开发的团队会立刻警觉——你精心设计的记忆系统可能在悄悄退化。这篇论文用实验数据戳破了「自动总结记忆」的幻觉,建议所有用LLM做长期任务的开发者点开看看,别让记忆成为瓶颈。