13:50François Chollet@fchollet精选François Chollet 指出,如果基准测试依赖静态数据集或训练时已知的静态分布,那么它本质上衡量的是记忆/检索,而非智能。他以 ARC 挑战为例,说明现有基准容易因数据泄露而失效,并强调真正智能需要应对未知变化。Chollet 呼吁社区设计更能体现泛化能力的测试,如基于动态环境的评估。行业François Chollet基准测试智能测评记忆检索ARC推荐理由:Chollet 点破了基准测试的痛点:很多高分模型只是背答案,不是真聪明。做评测的值得看看。原文