#强化学习

共 614 条 · 7 天 61 条 · 30 天 198 条 · 话题观测 →
5月19日
论文精选14:36
COOPO:循环离线-在线策略优化算法,提升强化学习效率

做强化学习研究的团队终于有了一个能同时解决分布偏移和灾难性遗忘的通用框架——COOPO 的循环设计让离线数据复用和在线探索形成正向循环,D4RL 上效果显著,建议做 RL 算法开发的同学点开看理论证明和实验细节。

arXiv cs.AI@Qisai Liu 等 6 人原文
产品Agent 与开发者多源确认83°10:41
Cursor 发布 Composer 2.5,基于 Kimi K2.5,马斯克证实使用 Colossus 2 算力训练

Cursor 这次在长任务和指令遵循上的改进,对重度使用 AI 编程助手的开发者来说体感会很直接,尤其是沟通风格和投入度校准这两个软维度优化,建议用 Composer 2.5 的团队直接试试。

事件专题
shao__meng@shao__meng11 个信源在谈原文
5月18日
产品21:59
波士顿动力Atlas用强化学习搬运100+磅冰箱,展示人形机器人重体力劳动能力

人形机器人从实验室走向真实体力劳动的关键一步——Atlas展示了如何通过强化学习和身体感知而非视觉来搬运重物,做机器人研发或物流自动化的团队值得关注,这可能是未来仓库搬运的雏形。

rohanpaul_ai@rohanpaul_ai原文
5月17日
5月16日
5月15日
5月14日
行业Agent 与开发者多源确认13:37
Karpathy 谈 AI 能力认知鸿沟:免费版 vs Codex/Claude Code 差距巨大

Karpathy 点破了 AI 圈最大的认知偏差——免费版和高端代理模型的能力差距已经大到像两个物种。如果你是做编程、数学或研究的开发者,看完会理解为什么有人觉得 AI 已经能替代数周工作,而有人还在嘲笑它犯蠢。

事件专题
官方账号Andrej Karpathy@karpathy11 个信源在谈原文
5月13日
论文精选70°19:12
Fast-Slow Training:让LLM像人类一样快慢结合持续学习

这篇论文解决了LLM在持续学习中灾难性遗忘和可塑性丧失的痛点,做模型微调、持续学习或Agent长期记忆的团队值得关注——FST框架让你不用在参数更新和上下文学习之间二选一,直接结合两者优势。

arXiv cs.AI@Rishabh Tiwari 等 9 人原文
5月12日