5月20日
08:22
08:22官方账号Simon Willison’s Weblog博客/媒体
精选
llm-gemini 0.32a0 版本发布,与 llm>=0.32a0 alpha 兼容。新版本增加了流式传输推理令牌的能力,让用户能实时看到模型的思考过程。这对于需要理解模型推理逻辑的开发者来说是一个重要更新。该版本主要面向使用 Gemini 模型的 LLM 命令行工具用户。
推荐理由:流式推理令牌让开发者能实时观察模型思考过程,做 AI 调试或教学演示的团队可以直接升级体验。
00:20
00:20官方账号Andrej Karpathy@karpathy
83°
AI 领域知名人物 Andrej Karpathy 宣布加入 Anthropic,重返大语言模型前沿研发。他认为未来几年将是 LLM 发展的关键形成期,对此充满期待。Karpathy 同时表示仍对教育保持热情,计划未来继续从事相关工作。这一消息引发社区广泛关注,被视为 Anthropic 在 AI 人才争夺中的重要收获。
事件专题

推荐理由:Karpathy 的加入意味着 Anthropic 在 LLM 前沿研发上再添重量级人物,关注 AI 模型竞争格局的开发者值得关注后续动向。
5月19日
5月18日
10:32
10:32官方账号arXiv cs.LG@Igor Bogdanov, Chung-Horng Lung, Thomas Kunz, Jie Gao, Adrian Taylor, Marzia Zaman
精选
FORGE 是一种无需梯度更新的智能体记忆进化协议,通过分层 ReAct 架构和群体广播机制,让 LLM 智能体从失败轨迹中生成可复用的知识(规则、示例或混合形式)。在 CybORG CAGE-2 网络防御任务中,FORGE 使所有 12 种模型配置的平均回报提升 1.7-7.7 倍(相比零样本基线),并降低严重失败率至约 1%。关键发现包括:群体广播是性能提升的核心机制,示例记忆对多数模型效果最佳,且较弱模型受益更显著。该工作为无需权重更新的智能体持续学习提供了新范式。
推荐理由:做智能体持续学习和自主决策的团队——FORGE 用群体广播解决了记忆进化中的灾难性遗忘问题,无需微调模型权重,直接提升任务成功率。做网络防御或 POMDP 场景的开发者值得关注其低成本高回报的实践路径。
5月17日
5月16日
23:25
23:25Gary Marcus@GaryMarcus
Gary Marcus在X上回应@Nima292,指出当前的大语言模型(LLM)并非通用人工智能(AGI),但已经会导致部分工作岗位流失。他认为,如果未来真正实现AGI,失业问题将更加严重。这一观点引发了关于AI对就业影响的讨论,提醒人们关注技术发展的社会后果。
推荐理由:Gary Marcus的这条推文戳中了AI从业者和政策制定者的焦虑点——LLM已经带来失业,AGI会更糟。关心AI社会影响的人值得一看,看完会思考技术发展的代价。
5月15日
5月14日
5月13日