#Miles
共 4 条 · 7 天 0 条 · 30 天 0 条
信息流里打上「Miles」标签的资讯、产品与论文,按刊登时间排,新的在上。
8月19日
7月23日
Miles 引入 OPD:使 Qwen3.5-35B 推理缩短 3 倍且精度提升
Miles 发布了 OPD 方法,让 Qwen3.5 模型推理更快更准,无需任务奖励,比传统蒸馏更高效,适合模型压缩场景。
7月11日
DeepSeek-V4 Flash RL 在 AMD MI355X 上完成端到端训练
DeepSeek-V4 Flash RL 在 AMD 显卡上跑通了,训练结果还不错,AIME 分数涨了一截。想试试 AMD 平台搞 RL 训练可以看看这篇。
6月12日
LMSYS 发布 TITO 技术:确保 RL 训练中每个 token 都在策略上
做 RL 训练或大模型推理的团队终于有了解决策略偏移的实用方案——TITO 让每个 token 都对齐,计算量还能省 10 倍,搞 Agent 训练的开发者值得点开看看。