AITP
精选全部 AI 动态AI 日报Agent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOP

Miles

共 4 条相关 AI 资讯
8月19日
11:45
11:45Aravind Srinivas@AravSrinivas
精选
RadixArk公司发布了Miles v0.1,这是一个开源的强化学习框架,专门用于训练LLM和多模态模型。该框架已在过去9个月内有72名贡献者提交了1,326次代码提交,并进行了85个GPU端到端CI测试。Miles已在Kimi K3、DeepSeek V4、Qwen 3.8、GLM 5.2等前沿开源模型上进行了实战测试。目前已有包括humansand、periodiclabs等多家公司在NVIDIA和AMD硬件上使用Miles进行前沿模型开发和生产强化学习工作负载。
AI产品MilesRadixArkDeepSeek
事件专题

推荐理由:RadixArk开源了Miles v0.1框架,帮你调试RL训练,提高硬件效率,已在多个前沿模型上验证。
原文
7月23日
22:38
22:38官方账号LMSYS Org (SGLang)@lmsysorg
精选
Miles 框架新增 On-Policy Distillation(OPD)作为一等训练原语。在 Qwen3.5-35B-A3B 上,纯 OPD 使推理 token 数从 18.6k 降至 5.5k–6.7k,缩短约 3 倍,同时 held-out DAPO 准确率从 0.8457 升至 0.8945。反向 KL 散度从 0.045 降至 0.010,学生模型收敛至教师。采用稀疏逐位置评分代替密集 O(R²K) 评分,提升效率。支持纯蒸馏或与 GRPO/PPO 奖励结合,计划扩展多教师和 RL 场景。
AI模型MilesOPDQwen3.5-35B
事件专题

推荐理由:Miles 发布了 OPD 方法,让 Qwen3.5 模型推理更快更准,无需任务奖励,比传统蒸馏更高效,适合模型压缩场景。
原文
7月11日
03:37
03:37官方账号LMSYS Org (SGLang)@lmsysorg
精选73°
LMSYS 发布博客,介绍 DeepSeek-V4 Flash RL 在 AMD Instinct MI355X GPU 上使用 Miles 框架完成端到端训练。训练100+步后,log-prob gap 稳定在0.09,AIME-2024 pass@1 从0.39提升至0.49,pass@8 从0.53提升至0.67。采用 FP8 推演加 BF16 演员模型,支持数据类型感知在线权重更新。在 ROCm 上实现了稳定的 TP1/PP4/EP4 布局,无集体通信停顿。混合注意力、mHC 混合和哈希路由 MoE 在 SGLang 和 Megatron 引擎间保持一致。
AI模型DeepSeek-V4AMDROCm

推荐理由:DeepSeek-V4 Flash RL 在 AMD 显卡上跑通了,训练结果还不错,AIME 分数涨了一截。想试试 AMD 平台搞 RL 训练可以看看这篇。
原文
6月12日
12:02
12:02官方账号LMSYS Org (SGLang)@lmsysorg
精选
LMSYS 在博客中介绍了 Token-In-Token-Out (TITO) 技术,用于解决强化学习中推理与训练 token 不一致导致的策略偏移问题。TITO 通过确保训练器使用推理引擎产生的精确 token,使每个 token 保持在策略上,从而提升训练效率。该技术将每个任务视为一个样本而非每个回合,在 30-50 回合的轨迹上可节省约 10 倍计算量。Miles 框架通过推理会话服务器、追加式 token 缓冲区、可插拔 TITO tokenizer 和 TokenSeqComparator 等组件实现 TITO。该技术已支持 Qwen3、GLM、Kimi-K2、Nemotron、Minimax 和 DeepSeek 等模型系列。
论文强化学习TITOMiles

推荐理由:做 RL 训练或大模型推理的团队终于有了解决策略偏移的实用方案——TITO 让每个 token 都对齐,计算量还能省 10 倍,搞 Agent 训练的开发者值得点开看看。
原文
精选全部日报登录