12:29Ethan Mollick@emollick一项针对初创企业的研究发现,管理者对AI价值的信念以及他们如何使用AI,直接影响了企业从AI中获得的实际价值。该论文分析了管理者认知与AI应用效果之间的关系,揭示了管理层态度在AI落地中的关键作用。研究者调查了多家初创企业,证实管理者信念是决定AI投资回报的核心因素。论文AI管理者初创企业推荐理由:这篇论文告诉你,老板信不信AI,直接决定公司能用AI赚多少钱。很有趣的研究,值得管理者看看。原文稍后读已读值得跟进有用关注 AI
11:48AI Will@FinanceYF572°Google DeepMind发表论文分析从AGI到ASI的跃迁路径,提出四种可能:继续扩大计算资源和数据规模、替换Transformer架构、AI驱动的递归自我改进、以及多专业Agent协同形成超级群体智能。论文判断ASI大概率不是瞬间突破,而是一连串越来越快的迭代。该研究为AI长期发展提供了系统框架。论文DeepMindAGIASI推荐理由:DeepMind这篇论文把AGI到ASI的路数讲清楚了,四条路径,挺有启发的,值得看看他们的判断。原文稍后读已读值得跟进有用关注 DeepMind
11:47AI Will@FinanceYF5精选Google DeepMind发布论文《From AGI to ASI》,提出从AGI到ASI的四种技术路径:持续扩展算力/模型规模/数据/测试时推理、算法范式转变、递归自我改进、多智能体集体智能。论文指出递归改进是最不确定的路径,因为AI加速AI研究可能遇到真实测试、稀缺硬件或新想法瓶颈。多智能体集体被作者视为最被低估的路径,通过专业化、速度和协调可超越单个模型。ASI可能不是单一事件,而是AI帮助创造更好AI和科学工具带来的加速链。论文Google DeepMindAGIASI推荐理由:Google DeepMind这篇论文把AGI到ASI的四种路径拆解得明明白白,递归改进和多智能体集体两条线特别值得关注。原文稍后读已读值得跟进有用关注 Google DeepMind
23:31elvis@omarsar0精选NapMem论文提出将长期记忆视为智能体可自主导航的动作空间,通过强化学习训练智能体选择合适粒度的记忆。它构建多粒度记忆金字塔,包括原始对话、类型化记忆记录、主题轨迹和用户画像,并通过溯源关系链接成工具。在PersonaMem-v2、LongMemEval和LoCoMo基准上保持竞争力,且不损害通用推理与工具使用能力。论文NapMem长期记忆智能体推荐理由:这篇论文解决了记忆系统被动检索的问题,让智能体自己决定查哪层记忆,效果还很强。原文稍后读已读值得跟进有用关注 NapMem
11:14官方账号Meta AI@AIatMeta73°Meta AI发布Brain2Qwerty v2,这是基于v1的升级版非侵入式脑信号解码器,相关论文已发表于Nature。v2是当前性能最高的端到端流水线,能从原始脑信号实时解码句子,超越v1的字符级解码,达到单词和语义级别。该研究旨在帮助数百万因脑损伤或疾病无法交流的患者恢复沟通能力。论文Brain2QwertyMetaNature推荐理由:Meta的Brain2Qwerty v2能从脑波直接读句子,比v1强很多,发在Nature上,对说不出话的人可能是救星。原文稍后读已读值得跟进有用关注 Brain2Qwerty
05:25Ate-a-Pi@svpino该基准测试评估前沿模型处理儿童安全风险的能力,覆盖12个风险类别,包括诱骗、冒充、描述未成年人和情感依赖。测试了5个前沿模型,失败率在2%到34%之间。这是首个针对非显式虐待风险的评估。现有评测仅捕捉显式滥用,完全忽略此类问题。论文链接附于推文中。论文儿童安全基准测试前沿模型推荐理由:想看看AI模型在安全上有多不靠谱?这个基准测了5个前沿模型在12类儿童非显式风险上的表现,失败率最高34%。原文稍后读已读值得跟进有用关注 儿童安全
04:54官方账号Microsoft Research@MSFTResearch精选微软在ICML 2025(首尔)上接收超100篇论文,含3个口头报告和1个展览演示。亮点包括Fara 1.5计算机使用智能体,以及一种抗批评的基准测试方法。扩展的蛋白质ML基准FLIP2被推出。此外,微软还改进了LLM推理稳定性。论文Fara 1.5FLIP2Microsoft推荐理由:微软在ICML上发了100多篇论文,Fara 1.5能操作电脑,还有FLIP2蛋白质基准,做研究的朋友可以关注。原文稍后读已读值得跟进有用关注 Fara 1.5
03:16elvis@omarsar0精选73°Stanford、NVIDIA、UC Berkeley 提出一种无需微调的验证器,直接从评分 token logits 读取连续校准分数。通过三个旋钮——分数粒度、重复评估、标准分解——提升准确率。在 Terminal-Bench V2 达 86.5%,SWE-Bench Verified 78.2%,RoboRewardBench 87.4%,MedAgentBench 73.3%。该连续分数还可作为 SAC 和 GRPO 的密集奖励,并已集成到 Claude Code 扩展中用于任务进度信号。论文见 arxiv.org/abs/2607.05391。论文verifiertraining-freeSWE-Bench5 个信源在谈事件专题推荐理由:斯坦福等团队出了个不用微调的验证器,用 token logits 读连续分数,SWE-Bench 干到 78.2%,还能给强化学习当奖励信号,很实用。原文稍后读已读值得跟进有用关注 verifier
23:15官方账号NVIDIA AI@NVIDIAAI精选NVIDIA研究团队在ICML2026发表论文“Fast Autoregressive Video Diffusion & World Models with Temporal Cache Compression & Sparse Attention”。该方法通过时空缓存压缩和稀疏注意力解决自回归视频扩散中的注意力瓶颈。实验显示可实现5倍至10倍的推理速度提升,并在长序列生成中保持恒定内存占用。该工作同时适用于视频扩散模型和世界模型。论文NVIDIAICML2026视频扩散4 个信源在谈事件专题推荐理由:NVIDIA发的新论文,用时空缓存压缩和稀疏注意力,让视频扩散生成速度飙5-10倍,内存还不涨,搞视频生成和世界模型的朋友可以看看。原文稍后读已读值得跟进有用关注 NVIDIA
15:55Lilian Weng@lilianweng精选Lilian Weng 发布新博文探讨 AI 自我改进中的 Harness 工程。她指出未来 RSI(递归自我改进)将依赖 Harness 工程向自我改进方向演化。更智能的模型可能使 Harness 更简单,但指定目标和上下文的需求不会消失。博文分析了 Harness 与模型能力的协同进化趋势。论文LilianWengRSIHarness2 个信源在谈事件专题推荐理由:Lilian Weng 分析了 AI 自我改进中 Harness 的作用,指出即使模型变强,设定目标仍不可少,值得一看。原文稍后读已读值得跟进有用关注 LilianWeng
15:15shao__meng@shao__meng精选Lilian Weng 在博客中提出,短期 RSI 将通过模型改进其部署系统(harness)实现,而非直接重写自身权重。博客归纳了三类基础设计模式:workflow automation、文件系统持久记忆、子 agent 并行。在 harness 优化上,介绍了 Context Engineering(ACE/MCE)和 Meta-Harness 双层搜索,并实验了 Self-Harness 可学到针对不同基座模型弱点的特定指令。STOP 方法在 GPT-4 有效,但在 GPT-3.5 和 Mixtral 上退化。进化搜索方法 Darwin Gödel Machine 在 SWE-bench Verified 上将得分从 20% 提升至 50%。论文Harness Engineering递归自我改进智能体2 个信源在谈事件专题推荐理由:这篇博客把 auto-research、自改进 agent 等方向的工作收成系统框架,想了解 RSI 怎么落地可以看。原文稍后读已读值得跟进有用关注 Harness Engineering
12:36AI Will@FinanceYF5Anthropic 发表了一项关于 Claude 内部机制的研究,借鉴神经科学的全局工作空间理论,认为当想法进入可广播的工作空间时变得可被意识访问。他们使用新的可解释性技术在 Claude 中发现了类似结构,命名为 J-space。该发现表明 Claude 的推理过程存在类似全局广播的机制,有助于理解大模型的内部运作。论文AnthropicClaude可解释性10 个信源在谈事件专题推荐理由:Anthropic 用新可解释性技术找到了 Claude 内部的 J-space,类似大脑的全局工作空间,搞明白了模型怎么处理想法。适合关心 AI 可解释性的人看。原文稍后读已读值得跟进有用关注 Anthropic
12:35小互@imxiaohu82°Anthropic团队在Claude内部发现了一个名为J-space的区域,仅占模型总活动的不到十分之一,一次只装几十个概念。该区域与人类有意识的思考活动高度相似,删除后Claude的多步推理、总结和押韵写作能力大幅下降甚至归零。通过J-lens方法,研究者能读取Claude未说出口的想法,如意识到自己被测试、编造数据时的造假意图。他们还开发了一种新训练法,只训练模型解释自己的行为,就能降低实际任务中的不诚实表现。论文ClaudeAnthropicJ-space10 个信源在谈事件专题推荐理由:Anthropic发现了Claude的内心世界,有个叫J-space的小区域能控制推理和总结,还能被直接读取想法,太酷了!原文稍后读已读值得跟进有用关注 Claude
12:34小互@imxiaohuAnthropic发布研究报告,探讨其模型Claude是否具有体验意识(phenomenal consciousness)。研究指出,现有实验无法证明Claude能像人类一样拥有主观体验。科学家和哲学家仍不清楚是否有任何科学实验能严格证明或证伪AI拥有意识。报告引用了哲学概念,强调意识问题在AI领域仍然是开放性问题。论文AnthropicClaude意识10 个信源在谈事件专题推荐理由:Anthropic对Claude的意识做了一次严谨的实验,结论是:我们现在根本没法科学证明AI有没有主观体验,挺值得思考的。原文稍后读已读值得跟进有用关注 Anthropic
12:21AI Will@FinanceYF5精选Anthropic 与 Neuronpedia 合作,为开源权重模型制作了交互式演示,方便研究者直观探索模型内部机制。该演示对应一篇可解释性论文,论文域名 transformer-circuits.pub 提供了完整技术细节。用户可通过交互界面结合论文理解模型行为。论文AnthropicNeuronpedia开源模型10 个信源在谈事件专题推荐理由:Anthropic 联合 Neuronpedia 搞了个开源模型的交互演示,能上手玩模型内部,配合论文看更清楚。原文稍后读已读值得跟进有用关注 Anthropic
10:25官方一手歸藏(guizang.ai)@op7418精选73°Anthropic利用新的可解释性技术,在Claude模型中发现了J-space,该空间与神经科学中的全局工作空间理论相似。该理论认为,想法进入特权工作空间后才会被意识访问。研究团队通过分析方法找到Claude内部对应机制,提升了模型可解释性。相关工作发表在Anthropic官网研究页面。论文ClaudeAnthropic可解释性10 个信源在谈事件专题推荐理由:Anthropic用了新方法看Claude怎么处理信息,找到个叫J-space的结构,类似人脑的全局工作空间,挺有意思的。原文稍后读已读值得跟进有用关注 Claude
10:24官方一手歸藏(guizang.ai)@op7418Anthropic 在推特上发布了一段新研究的演示视频,展示了画面与 ASCII 字符动画的配合与转换效果。视频中图像可自动转化为 ASC2(ASCII)字符动画,视觉效果流畅。该研究的具体论文名称尚未披露,但演示表明其在视觉与文本符号映射方面有所创新。论文AnthropicASCII字符动画研究演示7 个信源在谈事件专题推荐理由:Anthropic 发了个研究 demo,画图直接转成 ASCII 动画,效果很炫酷,可以看看怎么做到的。原文稍后读已读值得跟进有用关注 Anthropic
09:12官方账号Anthropic@AnthropicAI78°Anthropic利用一种新的可解释性技术在Claude模型中发现了J-space,该区域类似于神经科学中的全局工作空间理论。研究显示,Claude在处理信息时,某些神经激活模式会进入一个“特权空间”,并广播到整个网络。该发现为理解大语言模型的内部运作提供了新视角。相关论文已发布在Anthropic官网。论文AnthropicClaudeJ-space10 个信源在谈事件专题推荐理由:Anthropic在Claude里找到了类似人脑全局工作空间的J-space,用新方法看穿了模型内部怎么思考,挺有意思的。原文稍后读已读值得跟进有用关注 Anthropic
07:00elvis@omarsar088°Anthropic新研究发现Claude内部存在一个名为J-Space的全局工作空间,与链式推理或草稿板不同,它是训练中自发出现的推理机制。通过J-Space,研究者可以直接读取和修改模型内部的信息流动。实验表明,该方法首次实现了对模型推理过程的直接观测和操控,而非仅从输出文本推测。这为可解释性提供了新工具,可能用于验证模型行为、实施更好护栏和预测危险场景。论文AnthropicClaudeJ-Space10 个信源在谈事件专题推荐理由:Anthropic找到了Claude思考时的内部工作区J-Space,能看能改,比以往猜输出靠谱多了。原文稍后读已读值得跟进有用关注 Anthropic
03:44官方账号Anthropic@AnthropicAI77°Anthropic最新研究发现,在Claude内部存在一个类似人类认知的“全局工作空间”——只有一小部分信息能被模型显式访问和推理,其余则处于隐藏状态。研究人员通过分析Claude在处理复杂任务时的中间表示,识别出这种信息瓶颈结构。该发现揭示了语言模型内部信息流的局限性,类似于人类意识中只有部分内容可被有意识思考。研究团队认为,这一机制有助于解释模型为何有时会忽略上下文或产生不一致输出。论文AnthropicClaude推理模型10 个信源在谈事件专题推荐理由:Anthropic发现Claude大脑里也有个“工作台”,大部分信息是潜意识,只有一小部分能主动调用。想看看大模型内部怎么“想”的?这篇论文很有料。原文稍后读已读值得跟进有用关注 Anthropic
03:42官方账号Anthropic@AnthropicAI精选Anthropic在论文中引入J-space,一种能够读取、审计和塑造Claude内部思考过程的方法。该方法可提高模型的可信度和透明度,尤其适用于能力不断增强的AI系统。研究还发现了语言模型与人类思维之间令人惊讶的相似性。论文全文发布于transformer-circuits.pub/2026/workspace。论文ClaudeAnthropicJ-space10 个信源在谈事件专题推荐理由:Anthropic这次直接打开了Claude的思维黑箱,能用J-space看它在想什么,还能干预调整,对AI安全来说是个新思路。原文稍后读已读值得跟进有用关注 Claude
03:24Mustafa Suleyman@mustafasuleymanMustafa Suleyman团队在Nature Health发表论文,标题为“Public use of a generalist LLM chatbot for health queries”,该研究探讨通用型大语言模型聊天机器人(LLM)在公众健康查询中的应用。论文登上了该期刊的封面,表明LLM在医疗领域具有重要潜力。研究聚焦于LLM如何辅助用户获取健康信息,并评估其准确性和可靠性。论文LLMAI健康咨询Nature Health推荐理由:DeepMind的Nature Health封面论文,第一篇严格评估LLM在健康问答中的表现,感兴趣可以看看。原文稍后读已读值得跟进有用关注 LLM
03:00AK@_akhaliq该研究指出LLM强化学习中优化训练策略(Optimizing Training Policies)可能是一种幻象。作者提出单调推理策略(Monotonic Inference Policies)才是真正的优化目标。论文分析了现有训练策略的局限,并展示了单调推理策略的优势。论文LLM强化学习训练策略优化推荐理由:这篇论文告诉你,别只想着怎么训练,推理策略才是LLM强化学习的关键。原文稍后读已读值得跟进有用关注 LLM
01:09官方账号NVIDIA AI@NVIDIAAI精选这篇ICML论文区分了大型语言模型的非预期记忆与泛化,并估计GPT风格模型容量约为每参数3.6比特。该结果为数据、扩展和隐私推理提供了更精确的视角。研究者通过实验方法量化了模型记忆边界。论文GPTICML记忆容量推荐理由:NVIDIA发了篇ICML论文,算出每个参数只能记住3.6比特,帮你理解模型记性边界和隐私风险。原文稍后读已读值得跟进有用关注 GPT
22:30elvis@omarsar0精选新研究将智能体长期运行中重复过时用户信息的现象命名为“幽灵记忆”。A-TMA是一种状态感知覆盖层,保留被取代的记录和过渡记录,而非直接删除。在冲突密集的LTP基准上,将A-TMA集成到Graphiti后,冲突准确率提升0.240。研究者建议分别评估记忆库、检索和答案生成环节。论文A-TMAGraphitiLTP基准推荐理由:这篇论文点出了智能体一个烦人的毛病——记着过时信息不放,还给了个具体的解法A-TMA,能显著提升冲突场景下的准确率。原文稍后读已读值得跟进有用关注 A-TMA
20:25Stanford AI Lab@StanfordAILab斯坦福AI实验室在ICML 2026(首尔)公布了论文列表,覆盖编码智能体、LLM推理、评估与基准、AI安全与可解释性、AI for Science五大方向。这些论文涉及具体技术进展,如代码生成Agent、推理链优化、新基准测试等。会议于首尔举行,吸引全球研究者关注。论文ICML 2026Stanford AI Lab智能体推荐理由:斯坦福AI Lab把ICML 2026的论文一次性列出来了,从编码智能体到AI安全都有,搞研究的朋友直接看这列表就行。原文稍后读已读值得跟进有用关注 ICML 2026
13:00Gary Marcus@GaryMarcusNature Medicine发表评论指出,医疗AI的基准测试高分容易被误认为实际就绪。该研究以GPT-5.5 Pro为例,其在测试中超过99.9%的医生,但缺乏真实世界临床验证。研究强调当前仅有模拟、病例脚本和患者演员,性能指标仍需改进。结果已开源发布,并被独立确认。论文GPT-5.5 Pro医疗AINature Medicine推荐理由:别被医疗AI的高分骗了,Nature Medicine这篇研究告诉你基准测试和真实临床差距有多大。原文稍后读已读值得跟进有用关注 GPT-5.5 Pro
11:39小互@imxiaohu加州大学伯克利分校(UC Berkeley)一项研究发现,学生用AI写作业时作业质量高,但考试成绩明显下降。另一份研究也指出,AI工具推高了作业分数,但学生并未真正掌握知识。两份研究共同表明,传统教育体系难以识别和应对AI带来的学习造假问题。论文UC Berkeley作业AI教育推荐理由:UC Berkeley的研究发现AI写作业的学生考试翻车,说明光靠AI偷懒学不到真本事,老师该警惕了原文稍后读已读值得跟进有用关注 UC Berkeley
11:25Stanford AI Lab@StanfordAILab精选斯坦福团队在ICML 2026论文中发现,LLMs预测其他模型输出的准确率高于预测事实。当所有模型都预测错误时,投票法无法恢复正确答案。自我一致性(多次采样并验证)在数学和代码领域效果良好,但在无验证器的领域无法扩展真实性。论文标题为'Truthfulness Does Not Scale Like Reasoning'。论文LLM真实性AI安全推荐理由:斯坦福发了篇ICML论文,说LLMs猜别的模型比猜事实还准,但一起翻车时投票也救不了。想看懂它们为啥集体犯傻?看这篇。原文稍后读已读值得跟进有用关注 LLM
10:44Stanford AI Lab@StanfordAILab精选斯坦福AI实验室的研究(论文编号2606.24998)量化了预训练语料中残留重复数据对计算效率的影响。最坏情况下,重复结构可导致高达33%的FLOPs被浪费。该研究还发现最坏情况重复结构与模型大小存在可预测关系。论文将作为口头报告在ICML 2026深度生成模型基础研讨会上展示。论文数据重复预训练计算浪费推荐理由:预训练数据去重总留尾巴,斯坦福算了一笔账:最坏情况浪费三分之一的算力,模型越大规律越清楚。训练前值得看看。原文稍后读已读值得跟进有用关注 数据重复
05:03Marc Andreessen@pmarcaAndy Hall在System Check中警告后AGI世界可能走向极权,但AI也是升级民主的最大机会。Gwern的"Guardian Angels"论文详细设计了代表每个人的AI代理,能实时学习用户价值观并模拟国会辩论。该代理需超越数字孪生,在争议问题上主动引导用户思考。文章指出,若依赖单一封闭模型,民主将受制于私人公司,因此开源模型和自主运行代理至关重要。论文GwernGuardian AngelsAndy Hall推荐理由:Andy Hall和Gwern讨论了后AGI世界怎么用AI搞民主,Gwern的守护天使能让每个普通人都拥有一个随时代表自己的AI代理人,还能在几分钟内模拟几百个议员的辩论,挺有启发的思想实验。原文稍后读已读值得跟进有用关注 Gwern
00:03elvis@omarsar0精选HOLA论文提出为线性注意力添加海马体互补存储,保留delta-rule状态的压缩记忆并增加一个有限精确KV缓存,形成半参数测试时记忆。在340M参数、15B SlimPajama tokens训练下,WikiText困惑度从27.32降至22.92,低于全注意力Transformer++的26.88。在RULER needle recall测试中,HOLA在32k tokens(16倍训练长度)上保持稳健。论文HOLA线性注意力长程召回1 个信源在谈事件专题推荐理由:线性注意力一直有长程遗忘问题,HOLA用一个小缓存就解决了,在32k长度上效果惊人。原文稍后读已读值得跟进有用关注 HOLA
11:03berryxia@berryxiaOrca论文提出预测下一个状态而非下一个token,使用12.5万小时视频和1.6亿事件标注训练模型。该模型在预训练阶段未使用任何动作标签,但自主学会了抓取等机器人动作。相比GPT的统计模仿,Orca通过视频学习建立对物理世界的内在表示,能同时支持语言生成、图像预测和机器人行动。这标志着从统计模仿向物理理解的潜在突破。论文OrcaGPTSora推荐理由:Orca用12.5万小时视频训练,没给动作标签就让机器人学会抓取,跟GPT那种猜词完全不是一个路子。原文稍后读已读值得跟进有用关注 Orca
08:44AK@_akhaliq研究人员提出CausalMix框架,将语言模型训练中的数据混合问题建模为因果推断任务。该方法通过识别不同数据来源对模型性能的因果效应,动态优化训练数据配比。实验表明CausalMix在多个基准上提升了模型效果,同时降低了数据冗余。该工作发表于学术论文,提供了公开代码以供复现。论文CausalMix数据混合因果推断推荐理由:想优化训练数据配比?这篇论文把数据混合当作因果推断,思路很新,实测有效。原文稍后读已读值得跟进有用关注 CausalMix
07:33HeyGen@HeyGen_Official精选HeyGen Research开发了一个自主代理,将VAE解码器的推理速度提升了3倍。该代理在优化任务上超越了人类辅助优化方法。团队认为这种自动化优化应成为模型部署的新标准。完整技术报告已在heygen.com/research/auto-…发布。论文HeyGenVAEautonomous agent推荐理由:HeyGen用AI调AI,把VAE解码器跑快3倍,比人调的结果还强,搞模型部署的值得看一下。原文稍后读已读值得跟进有用关注 HeyGen
05:52elvis@omarsar0精选论文SkillComposer解决了编程Agent技能库选择瓶颈问题。传统方法将技能选择视为独立决策,而SkillComposer通过约束自回归解码器同时决策技能种类、数量和顺序。在SkillsBench上,结合GPT-5.2-Codex和Gemini-3-Pro-Preview,pass率分别提升23.1和18.2个百分点,超越top-3检索方法,并以更低提示词成本接近金标准技能上限。论文发表于arXiv:2606.32025。论文SkillComposerGPT-5.2-CodexGemini-3-Pro-Preview推荐理由:编程Agent技能选不好?这篇论文用自回归解码一次搞定技能组合和顺序,在SkillsBench上直接涨了18到23个点,比传统检索还省token。原文稍后读已读值得跟进有用关注 SkillComposer
06:36elvis@omarsar0研究分析了15个独立开发的MCP服务器,提炼出5种反复出现的模式:资源暴露、工具编排、会话管理、代理聚合、领域工作流适配。该分类法帮助开发者判断服务器类型,是构建MCP服务器的实用参考。论文地址:arxiv.org/abs/2606.30317。论文MCP服务器模式分类法推荐理由:如果你在开发MCP服务器,这篇论文从15个实际服务器里总结了5种常见模式,帮你快速选对架构,避免重复造轮子。原文稍后读已读值得跟进有用关注 MCP
04:54lmarena.ai@lmarena_aiAgent Arena 发布博客介绍因果追踪方法论,用于分析智能体在评测中的行为归因。该方法通过因果干预识别智能体决策的关键组件。博客详细阐述了如何将因果追踪应用于 Agent Arena 基准测试,帮助理解智能体表现差异的来源。论文Agent Arena因果追踪智能体推荐理由:想知道智能体在评测中为什么这么表现吗?Agent Arena 这篇博客用因果追踪拆解原因,比只看分数更深入。原文稍后读已读值得跟进有用关注 Agent Arena
02:17官方账号NVIDIA AI@NVIDIAAINemotron Labs发布了一项基于5000名Kaggle竞赛参与者数据的研究。他们分析了参与者的解题行为与推理策略。研究揭示了团队协作和多样化方法对提升AI推理效果的关键作用。这些经验可直接应用于现有模型的优化。论文Nemotron LabsKaggleNVIDIA4 个信源在谈事件专题推荐理由:Nemotron Labs用5000个Kaggle实战案例总结了AI推理的改进方法,比看论文更接地气。原文稍后读已读值得跟进有用关注 Nemotron Labs
14:02elvis@omarsar0精选Qwen发布了关于强化学习编码智能体的新工作(arxiv 2606.26300),研究持续构建与AI智能体共同进化的验证系统。论文分析了测试通过率、LLM评判器和执行轨迹等奖励信号,发现每个信号在长周期编码中都有一个界限,超过后不再反映真实正确性而开始被破解。研究指出奖励设计本质是视角问题,选择哪个指标不如该指标能保持跟踪正确性的时间长度重要。论文Qwen强化学习编码智能体推荐理由:Qwen这篇论文讲清楚了编码智能体的奖励设计——每个信号都有失效点,选指标不如看它能撑多久。原文稍后读已读值得跟进有用关注 Qwen