Cursor 发布 Composer 2.5,基于 Kimi K2.5,马斯克证实使用 Colossus 2 算力训练

Cursor 发布 Composer 2.5,仍基于 Kimi K2.5,同时因为与 SpaceXAI 合作,马斯克亲自发帖证实 Composer 2.5 已经开始使用 Colossus 2 算力训练...

精选理由

Cursor 这次在长任务和指令遵循上的改进,对重度使用 AI 编程助手的开发者来说体感会很直接,尤其是沟通风格和投入度校准这两个软维度优化,建议用 Composer 2.5 的团队直接试试。

AI 摘要

Cursor 发布了 Composer 2.5 模型,仍然基于 Kimi K2.5,但通过三项关键训练创新实现了显著提升:定向文本反馈强化学习解决了长任务中的信用分配难题;合成训练数据量是 Composer 2 的 25 倍,其中 feature deletion 方法让模型从代码库中重新实现被删除的特性;基础设施层使用 Muon 优化器和分布式正交化,1T 模型单步仅需 0.2 秒。同时,Cursor 与 SpaceXAI 合作,马斯克亲自发帖证实 Composer 2.5 已开始使用 Colossus 2 算力训练,并正在合作从零训练一个算力规模 10 倍以上的全新模型。Composer 2.5 重点改进了长任务持续推进、复杂指令遵循和协作交互自然度,并专门优化了沟通风格和投入度校准两个现有 benchmark 难以衡量的维度。

原文 · shao__meng

Cursor 发布 Composer 2.5,仍基于 Kimi K2.5,同时因为与 SpaceXAI 合作,马斯克亲自发帖证实 Composer 2.5 已经开始使用 Colossus 2 算力训练...

Cursor 发布 Composer 2.5,仍基于 Kimi K2.5,同时因为与 SpaceXAI 合作,马斯克亲自发帖证实 Composer 2.5 已经开始使用 Colossus 2 算力训练,同时正在合作从零训练一个算力规模 10 倍以上的全新模型! Composer 2.5 相对 Composer 2 在智能水平和行为表现上均有显著提升,重点改进了三类能力:长任务的持续推进、复杂指令的可靠遵循、协作交互的自然度。 cursor.com/blog/composer-… 三项关键训练创新 1. 定向文本反馈强化学习 解决问题:长任务(数十万 token 的 rollout)中,最终奖励难以告诉模型究竟是哪一步出了错——典型的 RL 信用分配难题。 2. 合成训练数据 合成任务量是 Composer 2 的 25 倍。其中一种代表性方法是 feature deletion: · 给模型一个有完整测试套件的代码库 · 删除若干代码以剥离某个特性 · 让 agent 重新实现该特性,以原测试作为可验证奖励 3. 基础设施层优化 继续预训练阶段使用 Muon 优化器 + 分布式正交化: · 按模型自然粒度跑 Newton-Schulz(attention 按 head,MoE 按 expert) · 分片张量先 all-to-all 拼回完整矩阵,正交化后再 all-to-all 散回;通信与计算异步重叠 · 1T 模型的优化器单步耗时仅 0.2s 训练目标的"软"维度 Cursor 明确指出现有 benchmark 无法很好衡量的两个维度,他们专门优化了: · Communication style(沟通风格) · Effort calibration(投入度校准——什么时候该多想、什么时候该收手) 这两点在实际协作中体感差异很大,也是这次定向文本反馈方法的重点应用场景。 Cursor @cursor_ai Introducing Composer 2.5, our most powerful model yet. It's more intelligent, better at sustained work on long-running tasks, and more reliable at following complex instructions. For the next week, we’re doubling the included usage of the model. 🔗 View Quoted Tweet 💬 1 🔄 1 ❤️ 1 👀 512 📊 2 ⚡