事件专题 · 官方一手

低资源语言中的思考:SFT构建、RL修复与准确率盲区

研究对三个前沿专家混合模型(阿里巴巴、OpenAI、NVIDIA,3.6-4.0B参数)进行微调,使其在低资源语言中推理。准确率基准显示几乎无变化,基准本身存在噪声(随机种子变动导致分数变化7.7点)。基础模型从不使用希腊语思考(0/1000推理轨迹),而SFT后98%的推理使用问题语言,且四个模型的语法判断均有提升。SFT无法修复自身缺陷,但强化学习可显著改善格式跳过和答案泄漏问题。

当前结论

论文揭示SFT和RL如何让模型真正用低资源语言思考,而非表面准确率提升,还发布了五个实用检查点。

11 个信源51° AI 热度最后更新 2026/8/18 13:09:03

证据链

相关来源 3Nathan Lambert: Interconnects
查看原文
相关来源 7AWS Machine Learning Blog
查看原文
相关来源 10Aravind Srinivas
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情