10:24官方账号arXiv cs.AI@Binnan Liu, Yechi Ma, Tian Xie, Wei HuaARC基准要求模型从少量输入输出样例推断变换并应用到新网格。TraceViT是一个循环视觉推理器,训练时通过程序实现改写生成中间网格状态,使每步迭代都对齐任务参考和对象工作区。在ARC-AGI-1上达到67.8% pass@2,在ARC-AGI-2上达到24.3%。消融实验显示,轨迹监督只有在配合grounding时才有收益。AI模型TraceViTARC-AGI-1ARC-AGI-2推荐理由:TraceViT在ARC上刷到67.8%,思路是让每步推理都有中间状态监督,代码还会开源,想搞视觉推理的可以盯一下。原文稍后读已读值得跟进有用关注 TraceViT
11:32官方账号arXiv cs.AI@Anmol Kankariya, Sercan Ö. ArıkPoTRE将推理过程解耦为四个代理:对抗细化代理、分层策略规划代理、频谱搜索代理和直接链代理,并通过任务自适应聚合层融合。在ARC-AGI-2、HLE和PRBench Finance三个基准上评估,PoTRE在HLE上达到49.92%的准确率,超越此前官方最佳成绩。该框架使用相似或更少的推理token实现了优于同质基线的推理性能。AI模型PoTRE多智能体推理推理模型推荐理由:这篇论文提出了PoTRE,用四个不同角色的智能体协作推理,在HLE上拿了新SOTA,而且比单纯堆参数的模型更省计算量。原文稍后读已读值得跟进有用关注 PoTRE
11:57官方账号arXiv cs.AI@Huan Zhu沙漏推理(Hourglass)是一种新的少样本归纳推理框架,通过强制推理阶段间的上下文隔离来提升大语言模型的归纳能力。在ARC-AGI-2视觉抽象基准上,使用GPT-5.5时,沙漏推理将5次尝试的最佳准确率比迭代改进基线提高了14个百分点。在ChipBench硬件综合任务中,使用GPT-5.5将Verilog综合准确率从31%提升至58%,几乎翻倍。在国际语言学奥林匹克的BBEH-Linguini谜题上,沙漏推理逆转了显式言语化对性能的损害趋势。消融实验证实,改进来源于阶段隔离和初始归纳质量,而非提示措辞或符号形式。论文HourglassGPT-5.5Gemini 3.1 Pro推荐理由:这篇论文提出沙漏推理,让GPT-5.5和Gemini 3.1 Pro在ARC-AGI、ChipBench等基准上大幅提升,不是靠新模型,而是靠精巧的推理结构设计,值得搞推理的人看看。原文稍后读已读值得跟进有用关注 Hourglass
09:52官方账号arXiv cs.LG@Johan Land该论文针对ARC-AGI-2视觉推理基准提出一种新求解器,将文本、图像和代码作为独立搜索算子生成多样候选轨迹,并通过上下文保留的整体判断模型在长上下文提示中联合比较所有候选。在ARC Prize半私有评估集上取得72.9%准确率,成本38.99美元/任务,超过GPT-5.2 Pro的54.2%和Gemini 3 Pro的54.0%。在公开评估集上达到76.1%,成本19.69美元/任务。作者开源完整代码,并报告了负面结果,如规定性提示模板和迭代细化会系统性降低假设多样性。论文ARC-AGI-2GPT-5.2 ProGemini 3 Pro推荐理由:这篇论文的方法很实在,用多模态搜索加整体判断,在ARC-AGI-2上做到了72.9%,比GPT-5.2 Pro高了将近19个点,代码还开源了。原文稍后读已读值得跟进有用关注 ARC-AGI-2