7月9日
7月8日
04:54
04:54官方账号Microsoft Research@MSFTResearch
精选
微软在ICML 2025(首尔)上接收超100篇论文,含3个口头报告和1个展览演示。亮点包括Fara 1.5计算机使用智能体,以及一种抗批评的基准测试方法。扩展的蛋白质ML基准FLIP2被推出。此外,微软还改进了LLM推理稳定性。
推荐理由:微软在ICML上发了100多篇论文,Fara 1.5能操作电脑,还有FLIP2蛋白质基准,做研究的朋友可以关注。
7月7日
12:21
10:25
03:42
03:42官方账号Anthropic@AnthropicAI
精选
Anthropic在论文中引入J-space,一种能够读取、审计和塑造Claude内部思考过程的方法。该方法可提高模型的可信度和透明度,尤其适用于能力不断增强的AI系统。研究还发现了语言模型与人类思维之间令人惊讶的相似性。论文全文发布于transformer-circuits.pub/2026/workspace。
事件专题

推荐理由:Anthropic这次直接打开了Claude的思维黑箱,能用J-space看它在想什么,还能干预调整,对AI安全来说是个新思路。
01:09
01:09官方账号NVIDIA AI@NVIDIAAI
精选
这篇ICML论文区分了大型语言模型的非预期记忆与泛化,并估计GPT风格模型容量约为每参数3.6比特。该结果为数据、扩展和隐私推理提供了更精确的视角。研究者通过实验方法量化了模型记忆边界。

推荐理由:NVIDIA发了篇ICML论文,算出每个参数只能记住3.6比特,帮你理解模型记性边界和隐私风险。
7月6日
7月5日
05:03
05:03Marc Andreessen@pmarca
Andy Hall在System Check中警告后AGI世界可能走向极权,但AI也是升级民主的最大机会。Gwern的"Guardian Angels"论文详细设计了代表每个人的AI代理,能实时学习用户价值观并模拟国会辩论。该代理需超越数字孪生,在争议问题上主动引导用户思考。文章指出,若依赖单一封闭模型,民主将受制于私人公司,因此开源模型和自主运行代理至关重要。
推荐理由:Andy Hall和Gwern讨论了后AGI世界怎么用AI搞民主,Gwern的守护天使能让每个普通人都拥有一个随时代表自己的AI代理人,还能在几分钟内模拟几百个议员的辩论,挺有启发的思想实验。
7月1日
06:36
04:54
04:54lmarena.ai@lmarena_ai
Agent Arena 发布博客介绍因果追踪方法论,用于分析智能体在评测中的行为归因。该方法通过因果干预识别智能体决策的关键组件。博客详细阐述了如何将因果追踪应用于 Agent Arena 基准测试,帮助理解智能体表现差异的来源。
推荐理由:想知道智能体在评测中为什么这么表现吗?Agent Arena 这篇博客用因果追踪拆解原因,比只看分数更深入。
02:17
02:17官方账号NVIDIA AI@NVIDIAAI
Nemotron Labs发布了一项基于5000名Kaggle竞赛参与者数据的研究。他们分析了参与者的解题行为与推理策略。研究揭示了团队协作和多样化方法对提升AI推理效果的关键作用。这些经验可直接应用于现有模型的优化。
事件专题

推荐理由:Nemotron Labs用5000个Kaggle实战案例总结了AI推理的改进方法,比看论文更接地气。