23:22elvis@omarsar0精选Pathway的BDH-CQ模型在ARC-AGI 1基准上获得29.5%的分数,但每个任务成本仅为0.0007美元。该模型通过潜在空间中的循环推理而非链式思维(CoT)来实现这一成绩。研究团队还验证了类似Transformer的扩展规律,参数规模可达6000亿。这一成果展示了在成本效率上的显著优势。AI模型BDH-CQARC-AGIPathway推荐理由:Pathway的BDH-CQ用极低成本在ARC-AGI 1拿到29.5%,靠的是潜在空间推理而不是CoT,还验证了600B参数规模,值得一看。原文稍后读已读值得跟进有用关注 BDH-CQ
11:31官方账号Greg Brockman@gdbARC Prize团队重新测试了OpenAI的GPT-5.6 Luna,在ARC-AGI-2上取得59.6%准确率,每任务成本0.18美元。在ARC-AGI-1上取得90.7%准确率,每任务成本0.07美元。降价后新结果与原始性能一致,而成本降低了80%。这一价格性能比在推理模型中相当少见。AI模型GPT-5.6 LunaOpenAIARC-AGI10 个信源在谈事件专题推荐理由:ARC Prize实测了降价后的GPT-5.6 Luna,性能没缩水,跑一次ARC-AGI-2只要0.18美元,性价比确实猛。原文稍后读已读值得跟进有用关注 GPT-5.6 Luna
03:16Gary Marcus@GaryMarcus精选Gary Marcus在X平台驳斥了一个热门类比,该类比将LLM比作“缸中之脑”。有人以ARC-AGI 3为例提问,若大脑不接身体是否还能完成该测试,并认为加装工具等同于拥有身体。Marcus认为此类比不成立,因为人类智力依赖的是前额叶皮层这一关键脑区。他强调harness应当是大脑自身的组成部分,而非外部附加的传感器或肢体。行业GaryMarcusARC-AGILLM推荐理由:Gary Marcus怼了个流行类比:别把LLM当缸中脑,人的智力靠前额叶,不是靠身体。看看他咋说的。原文稍后读已读值得跟进有用关注 GaryMarcus
18:01官方账号Decoder@Matthias Bastian86°Anthropic的Claude Opus 5在ARC-AGI-3基准测试中取得30.2%的成绩,接近此前GPT-5.6 Sol记录7.8%的四倍。测试开发者指出,Opus 5是首个独立推导出反射方程的模型,这一行为此前从未在其他模型中出现。开发者认为这归因于其更强的逻辑推理能力。ARC-AGI-3被设计为衡量真实智能的测试。AI模型Opus 5GPT-5.6 SolAnthropic10 个信源在谈事件专题推荐理由:Anthropic的Opus 5在智能测试上把GPT-5.6 Sol甩开一大截,还自己学会推方程了。原文稍后读已读值得跟进有用关注 Opus 5
11:58官方账号arXiv cs.LG@Haozhe Huang, Yudong Xu, Abhijoy Mandal, Alán Aspuru-Guzik离散扩散模型通过组合多个预训练专家实现复杂推理生成,但现有方法基于全样本加权,忽略了专家在空间或功能上的特化。本文提出FactorDiff,将生成样本分解为更小的因子,并在采样过程中动态路由每个因子到最相关专家。FactorDiff在ARC-AGI基准上验证了空间/像素级组合,其简单因子级路由在需要逻辑一致性和空间解耦的任务上持续优于复杂的全局标量加权方案。论文FactorDiffARC-AGI离散扩散模型推荐理由:这篇论文把专家组合从全局加权改成了因子级路由,在ARC-AGI上效果更好,适合研究离散扩散或组合生成的人看。原文稍后读已读值得跟进有用关注 FactorDiff
13:05官方账号ARC Prize@arcprize精选ARC Prize 团队提前获得了 Anthropic 的 Fable 5 模型访问权限,但由于 Anthropic 针对 Mythos 类模型的新数据保留条款,他们无法运行已验证的半私有 ARC-AGI-1/2/3 评估。团队正在与 Anthropic 协商,以确保 ARC 验证数据的隐私性。评估分数将在安全运行条件满足后公布。这一事件凸显了 AI 模型评估中数据隐私与模型访问权限之间的冲突。行业AnthropicFable 5ARC-AGI10 个信源在谈事件专题推荐理由:AI 评估社区和关注模型安全的研究者值得关注——数据条款正在影响基准测试的独立性,这直接关系到模型能力的可信度。原文稍后读已读值得跟进有用关注 Anthropic
19:10rohanpaul_ai@rohanpaul_ai精选72°伊利诺伊大学和清华大学等实验室的研究发现,LLM智能体在持续重写自身记忆时,记忆会变得不可靠。许多智能体系统通过让LLM将混乱经验压缩成整洁教训来存储过往工作,但论文表明反复重写会逐渐损害记忆。原始经验(实际尝试和解决方案)往往比精炼后的教训更有用。在网页购物、模拟世界、应用使用和ARC-AGI谜题等任务中测试,GPT-5.4在无记忆时解决100%的ARC-AGI任务,但用正确解决方案构建记忆后,流式更新导致准确率降至约54%。失败源于错误分组、过度泛化和过拟合,记忆丢失细节、混淆任务类型或学习到仅适用于狭窄示例的规则。论文建议智能体记忆不应自动将每次经验重写为摘要,保留原始证据并仅偶尔制作摘要效果更好。论文LLM智能体记忆机制可靠性推荐理由:做AI智能体开发的团队会立刻警觉——你精心设计的记忆系统可能在悄悄退化。这篇论文用实验数据戳破了「自动总结记忆」的幻觉,建议所有用LLM做长期任务的开发者点开看看,别让记忆成为瓶颈。原文稍后读已读值得跟进有用关注 LLM智能体