Shopify 0.8B 模型在专门任务上超越 GPT-5.6-sol
Shopify ML 团队微调后的 0.8B 小模型,在一个高度专门化的任务上打败了 GPT-5.6-sol (xhigh) ! 这是三天前 Shopify CEO @tobi 分享的团队案例: h...
Shopify 团队解释了如何用小模型超越大模型,关键是数据飞轮和自蒸馏技术,还揭示了 prompt 工程的局限性。
Shopify ML 团队微调后的 0.8B 小模型在 Buyer Profile 任务上获得 84.6 分,击败了 GPT-5.6-sol (xhigh)。团队采用数据飞轮 + on-policy self distillation 方法论,通过从真实流量采样低分输出,用强推理模型修正错误,再进行蒸馏训练。该方法通过梯度下降在连续参数空间优化,而非离散词法空间,将 system prompt 从 9.1K 压缩到 1.1K tokens。
Shopify ML 团队微调后的 0.8B 小模型,在一个高度专门化的任务上打败了 GPT-5.6-sol (xhigh) ! 这是三天前 Shopify CEO @tobi 分享的团队案例: h...
Shopify ML 团队微调后的 0.8B 小模型,在一个高度专门化的任务上打败了 GPT-5.6-sol (xhigh) ! 这是三天前 Shopify CEO @tobi 分享的团队案例: x.com/shao__meng/sta… 今天 Shopify ML 团队 @Drewch 从技术视角给咱们解释明白:为什么这是可能的、方法论是什么、代价是什么? # 方法论:数据飞轮 + on-policy self distillation McNamara 描述的数据闭环,结合他们 ICML 2026 讲座的摘要,可以拆成四步: 1. 可靠评估先行:用人工标注校准的 LLM-as-judge 作为唯一权威指标。没有可信的 judge,后面一切无从谈起。 2. 从生产分布中持续挖错:不是造合成题,而是从真实流量里采样低分输出。这保证了训练数据分布 = 推理时的分布。 3. 用强推理模型 + 人工修复:让高推理模型批判并修正错误输出,必要时升级到人工。关键细节是——不只是给正确答案,而是在训练时给模型"提示",让它自己生成正确的输出。 4. 把修复后的样本折回训练,重跑蒸馏(SFT + on-policy distillation + GRPO),再部署,再采样,循环。 "On-policy self distillation" 为什么重要: · 传统(off-policy)蒸馏是让学生模仿老师写好的答案,但学生自己推理时走的路径和老师不同,训练/推理分布不匹配。 · On-policy 是让学生自己采样轨迹,老师(或带 privileged 提示的自己)在每个 token 上给密集的监督信号。学生学到的是"在我自己会走到的状态下该怎么做"。 · "Self" 意味着 teacher 和 student 可以是同一个模型,只是 teacher 看到了额外信息(hints、正确答案、批判意见),student 只看到原始问题。模型学会在没有提示的情况下复现有提示时的行为。 · 结果就是帖子里那句话:推理能力被写进权重,推理时不再需要"高推理模式"——这直接解释了为什么 0.8B 不用 thinking 就能打 xhigh。 # 连续空间 vs 离散空间 帖子里最有洞察力的一段,也是对当前业界主流做法的直接批评: 用梯度下降在连续空间里改进,比在离散的词法空间里改进要好得多。 翻译过来:大多数团队修 bug 的方式是往 system prompt 里加规则。这有几个结构性问题: · Prompt 是离散的、脆弱的,加一条规则可能破坏另一条; · Prompt 越长,成本和延迟越高(图里 9.1K tokens 就是这么堆出来的); · 每条规则是人的猜测,不是从数据里学出来的。 而梯度下降是在连续参数空间里做平滑优化,可以同时吸收成千上万条修正案例,不会相互打架。Shopify 另一篇工程博客的说法更直接:"每一轮循环起点是一个更强的模型,而不是一个更复杂的 harness",system prompt 从 9.1K 压到 1.1K 的 gist tokens,正是这个思路的落地——规则进了权重,prompt 就可以瘦下来。 # 代价:失去泛化能力,但会大幅提升质量、降低延迟和成本 0.8B 模型在 Buyer Profile 上 84.6 分,不代表它能做别的任何事。它本质上是一个"任务专用编译产物"。这对应的适用边界是: · 任务定义清晰、流量大、分布相对稳定; · 有能力构建可信的 judge; · 有持续的生产反馈通道。 Andrew McNamara @Drewch I'm realizing from the flywheel thread from @tobi that many people don't realize that small models can actually outperform larger models on a specific task - @MParakhin has been saying this for quite some time. 🧵 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 4 👀 502 📊 2 ⚡