Francois Chollet：静态基准测的就是记忆，不是智能

精选理由

Chollet 点破了基准测试的痛点：很多高分模型只是背答案，不是真聪明。做评测的值得看看。

AI 摘要

François Chollet 指出，如果基准测试依赖静态数据集或训练时已知的静态分布，那么它本质上衡量的是记忆/检索，而非智能。他以 ARC 挑战为例，说明现有基准容易因数据泄露而失效，并强调真正智能需要应对未知变化。Chollet 呼吁社区设计更能体现泛化能力的测试，如基于动态环境的评估。

AI 翻译 · 中文

François CholletIf your benchmark relies on a static dataset or sampling from a static distribution densely known at training time, then it is fundamentally measuring memorization/retrieval. Which might be fine if you're looking for a r…

查看原推