全部 AI 动态 · AI 热点

6月29日

19:47

19:47

eric zakariasson@ericzakariasson

73°

Elon Musk在推文中透露，Cursor团队为v9模型的SFT和RL训练做出了重要的工程贡献。当前1.5T参数量的模型已通过补充训练加入Cursor数据。而两周前开始的2T参数量训练在数据范围和规模上大幅改进，训练配方也获得多项升级，预计7月底完成，8月发布。

AI模型 Elon Musk Cursor v9 SFT RL

推荐理由：Elon Musk说他们和Cursor团队合作训练v9模型，2T参数量的版本数据更全，8月就能见到，值得关注。

6月25日

05:58

05:58

Fireworks AI@FireworksAI_HQ

Fireworks AI 宣布其平台现支持对开源编码模型 GLM 5.2 进行微调，涵盖 SFT、DPO 和 RL 三种方法。GLM 5.2 在多个编码基准上表现强势，但 Fireworks 指出排行榜赢家未必适合你的代码库，微调可缩小差距。训练后的模型可直接在同一生产栈上提供服务，无需切换或迁移。早期客户反馈热烈，目前开放私测申请。

AI产品 GLM 5.2 Fireworks SFT DPO 微调

推荐理由：想用最强开源编码模型但通用版不顺手？Fireworks 让你微调 GLM 5.2，SFT/DPO/RL 全包，训练完直接上线，不用折腾。

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

6月12日

12:57

AITOP6月12日 12:57

Claude代码里藏了个20260612，18个月后的AI记忆革命已经开始倒计时

6月11日

15:28

AITOP6月11日 15:28

1107 vs 303：谷歌悄悄开源了一个“拆打字机”的模型，把大模型速度翻了4倍

15:23

AITOP6月11日 15:23

DiffusionGemma颠覆文本生成？自回归模型的“统治”要结束了

15:07

AITOP6月11日 15:07

每秒1107个token，Google开源的扩散模型为什么能改变本地推理格局？

5月16日

21:49

21:49

向阳乔木@vista8

本文用简洁的图示对比了三种主流大语言模型后训练技术：SFT（监督微调）让模型学会遵循指令；DPO（直接偏好优化）使输出更符合人类偏好；GRPO（群体相对策略优化）进一步激发模型的推理和思考能力。三者在训练目标和方法上层层递进，是当前LLM对齐和增强推理能力的关键技术路径。对于想了解模型训练流程或优化模型输出的开发者，这是一份直观的入门参考。

AI模型 LLM 后训练 SFT DPO GRPO

推荐理由：想搞懂LLM后训练技术栈的开发者，这张图帮你三分钟理清SFT、DPO、GRPO的关系和演进逻辑，建议收藏。