02:10Gary Marcus@GaryMarcusFrançois Chollet 在 X 上回应 Gary Marcus 的帖子,承认自己 2023 年至 2024 年初低估了大语言模型的长期重要性。他表示,2024 年 12 月 o3 模型在测试时计算(TTC)上的突破让他改变了观点。Chollet 指出,2023 年初“仅靠扩展基础 LLM 就能解决 AGI”的叙事并未实现。当前基础 LLM 在 ARC 1 上表现不佳,甚至无法可靠完成简单数学运算。行业Cholleto3ARC推荐理由:Chollet 承认以前低估了 LLM,现在说纯 scaling 不行,o3 的 TTC 才是关键。原文稍后读已读值得跟进有用关注 Chollet
10:30官方账号arXiv cs.AI@Hannah M. Liu, Rhea Saxena, Shiv AsthanaTrustX Agent Risk Classification Framework (ARC) 提出一种可重复的结构化方法,适用于七类智能体AI系统。框架核心是一个十二维度评分规则,结合GPA+IAT分类模型和五级自主性框架,输出三级治理输出与映射控制建议。还包含专门的编程助手扩展,处理此类AI系统的细微差别。该框架面向AI治理从业者、风险官、开发者和监管者,并计划定期迭代。论文TrustX Agent Risk Classification FrameworkARC智能体推荐理由:这篇论文给了一套为智能体AI系统定风险等级的方法,有十二个打分维度,还专门考虑了编程助手场景,做AI治理的可以看看。原文稍后读已读值得跟进有用关注 TrustX Agent Risk Classification Framework
13:50官方账号François Chollet@fchollet精选François Chollet 指出,如果基准测试依赖静态数据集或训练时已知的静态分布,那么它本质上衡量的是记忆/检索,而非智能。他以 ARC 挑战为例,说明现有基准容易因数据泄露而失效,并强调真正智能需要应对未知变化。Chollet 呼吁社区设计更能体现泛化能力的测试,如基于动态环境的评估。行业François Chollet基准测试智能测评推荐理由:Chollet 点破了基准测试的痛点:很多高分模型只是背答案,不是真聪明。做评测的值得看看。原文稍后读已读值得跟进有用关注 François Chollet
09:46官方一手arXiv: DeepSeek@Xu-Jing Ye, Yuan-Gen Wang, Ruping WangL-VARC是一种新框架,通过语言引导的LUPI分支增强视觉推理,解决ARC任务中纯语言模型参数大、纯视觉模型过拟合的问题。它利用DeepSeek-V3压缩语义,用CLIP对齐视觉与语义特征,训练后丢弃语言分支,仅保留18M参数的轻量模型。实验表明,L-VARC在ARC任务上超越现有最佳方法,代码已开源。论文视觉推理ARCLUPI推荐理由:ARC是AGI的关键测试,L-VARC用语言引导视觉推理,18M参数就能超越SOTA,做视觉推理或小模型研究的开发者值得一试。原文稍后读已读值得跟进有用关注 视觉推理