6月2日
5月29日
13:02
13:02官方一手arXiv: DeepSeek@Haochen Yang, Ke Zhao, Mengyuan Ma, Xingyu Lu, Xiangfeng Wang, Hong Qian
精选
OptSkills 是一种面向优化建模与求解的智能体系统,通过聚类问题原型而非表面叙事来提升泛化能力。它利用大语言模型自动从自然语言中提取优化问题,并在聚类内探索多样建模与求解配置,将成功轨迹蒸馏为可复用的工作流技能。在多个数据集上达到 68.27% 的微平均准确率,在 MIPLIB-NL 基准上以 26.91% 超越 DeepSeek-V3.2-Thinking 4.53%。该系统还支持在分布外场景下通过新轨迹扩展技能库,代码和技能已开源。
推荐理由:做运筹优化或自动化建模的团队终于有了能应对问题类型变化的通用方案——OptSkills 通过原型聚类和技能蒸馏解决了传统方法对叙事变体敏感的问题,值得在复杂优化任务中试试。
11:05
11:05官方账号arXiv cs.AI@Yaxin Luo, Jiacheng Cui, Xiaohan Zhao, Xinyi Shang, Jiacheng Liu, Xinyue Bi, Zhaoyi Li, Zhiqiang Shen
精选
大语言模型的预训练数据混合比例决定了其能力与缺陷,但这一信息极少公开。LLMSurgeon 提出“数据混合手术”框架,仅通过模型生成的文本就能逆向估计其预训练语料的领域分布。该方法利用校准后的软混淆矩阵解决领域混淆问题,在开源模型上验证了高精度。这为审计基础模型的数据构成提供了无需访问训练数据的实用后验方案。
推荐理由:想知道你用的模型到底吃了什么数据?LLMSurgeon 让数据审计变得可行,做模型安全、数据治理或开源复现的团队值得关注。
5月28日
5月26日
5月22日
11:11
11:11官方账号arXiv cs.AI@George Tsoukalas, Anton Kovsharov, Sergey Shirobokov, Anja Surina, Moritz Firsching, Gergely Bérczi, Francisco J. R. Ruiz, Arun Suggala, Adam Zsolt Wagner, Eric Wieser, Lei Yu, Aja Huang, Miklós Z. Horváth, Andrew Ferrauiolo, Henryk Michalewski, Codrut Grosu, Thomas Hubert, Matej Balog, Pushmeet Kohli, Swarat Chaudhuri
精选72°
研究人员首次大规模评估了用大语言模型生成形式化证明(Lean 语言)解决开放数学问题的能力。其最强大的智能体以每个问题几百美元的成本,自主解决了 353 个开放 Erdős 问题中的 9 个,并证明了 492 个 OEIS 猜想中的 44 个。该智能体已被部署在组合数学、优化、图论、代数几何和量子光学研究中。一个更基础的智能体(交替 LLM 生成与 Lean 验证)也复现了 Erdős 问题的成功,但在最难问题上成本更高。这些结果展示了 AI 辅助形式化证明搜索的潜力,并揭示了实现这一能力的智能体设计。
推荐理由:数学研究者终于有了能真正解决开放问题的 AI 工具——成本可控且覆盖多个数学分支,做组合数学或图论的人可以直接用这个智能体尝试自己的猜想。
5月21日
5月20日
10:31
10:31官方账号arXiv cs.AI@Wen Shi, Zhe Wang, Huafei Huang, Qing Qing, Ziqi Xu, Qixin Zhang, Xikun Zhang, Renqiang Luo, Feng Xia
精选
TERGAD 是一种新型图异常检测框架,通过大语言模型将节点拓扑属性转化为自然语言描述,生成高维语义嵌入,再与原始节点特征自适应融合。该方法解决了现有文本增强方法忽略节点结构上下文的问题,能检测由内容与拓扑不一致导致的复杂异常。在六个真实数据集上,TERGAD 持续优于现有基线,消融实验验证了结构语义引导和门控融合机制的有效性。代码已开源。
推荐理由:做图异常检测的研究者终于有了一个能同时利用结构语义和文本特征的框架——TERGAD 用 LLM 把拓扑信息翻译成自然语言,比纯数值特征更易捕捉异常模式,建议做 GAD 的团队直接跑一下开源代码。
08:26
08:26shao__meng@shao__meng
91°
AI 领域知名研究者、前 OpenAI 成员、特斯拉 AI 总监 Andrej Karpathy 宣布加入 Anthropic。他表示未来几年大语言模型前沿将极具塑造力,自己非常兴奋能重返研发岗位。Karpathy 同时强调仍对教育充满热情,计划继续推进相关工作。这一动向引发社区广泛关注,被视为 Anthropic 在 AI 前沿竞争中的重要人才布局。
事件专题

推荐理由:Karpathy 是 AI 领域最具影响力的研究者之一,他的加入意味着 Anthropic 在 LLM 前沿的研发力度将进一步加强。关注大模型技术走向的开发者、研究者和 AI 从业者,值得留意他接下来的工作方向。
5月19日
11:45
11:45官方账号arXiv cs.AI@Christiaan G. A. Viviers, Koen de Bruin, Mirre M. Trines, Ayla M. Hokke, Roy van der Meel, Avi Schroeder, Twan Lammers, Willem J. M. Mulder, Fons van der Sommen
精选
纳米医学研究分散在大量文献中,现有AI主要聚焦于性质预测和配方优化,缺乏对研究方向选择的证据支持。研究者提出pArticleMap系统,结合文章嵌入、相似图分析、稀疏前沿提取和结构化证据包检索,利用大语言模型在低密度桥接区域和聚类界面生成引文支持的假设。在回顾性基准测试中,系统在任务级保留假设上实现了10.8%的黄金回收率和15.9%的召回@10,61.0%的未来邻域率表明系统能准确预测研究前沿。人机一致性中等,表明系统作为辅助工具而非替代专家判断。
推荐理由:纳米医学研究者常面临文献碎片化、方向选择困难的痛点,pArticleMap通过证据驱动的假设生成帮你发现被忽视的研究交叉点,做纳米药物设计或跨学科转化的团队值得一试。
5月14日
15:02
15:02kimi_moonshot@Kimi_Moonshot
Kimi K2.6 在 OpenRouter 的每周大语言模型排行榜中升至第一名。这一成绩反映了开发者社区对 Kimi 模型的认可和实际使用效果。Kimi 团队对开发者的支持表示感谢,并承诺将继续迭代优化。对于关注模型性能排名的开发者来说,这是一个值得关注的动态。

推荐理由:Kimi K2.6 在 OpenRouter 周榜登顶,说明它在实际使用中获得了开发者认可,做模型选型或对比的团队可以关注这个新选择。
5月13日
19:12
19:12官方账号arXiv cs.LG@Kexuan Shi, Hanxuan Li, Zeju Qiu, Yandong Wen, Simon Buchholz, Weiyang Liu
精选
Pion 是一种用于大语言模型训练的新型优化器,通过左右正交变换更新权重矩阵,在整个训练过程中保持其奇异值不变。与 Adam 和 Muon 等加法优化器不同,Pion 在固定权重矩阵谱范数的同时调节其几何结构,提供了一种稳定的优化机制。实验表明,Pion 在 LLM 预训练和微调中均能作为标准优化器的稳定且有竞争力的替代方案。
推荐理由:Pion 解决了传统优化器在训练中破坏权重矩阵谱结构的问题,做 LLM 训练的研究者和工程师值得关注,尤其适合追求训练稳定性和模型质量的团队。
5月12日
18:54
18:54Ethan Mollick@emollick
该推文指出,LLM的一个重要特性是,更新、更大的模型在所有任务上都表现更好。AI实验室正投入大量资源到编码等经济价值高的领域,但研究表明,更大的模型在谈判、对齐、诗歌等其他领域同样表现出色。这一观点强调了模型规模对能力提升的普遍影响。
推荐理由:这一观点提醒从业者,模型规模的提升可能带来广泛的能力增强,而不仅仅是特定领域的进步,这对资源分配和模型评估有参考价值。