#模型微调
共 12 条 · 7 天 1 条 · 30 天 2 条
信息流里打上「模型微调」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月7日
9月23日
Anthropic 工程师解释 Claude 写作退步:模型被训练成写给 AI 看
Claude 写作为啥越来越怪?Anthropic 微调工程师亲口解释了原因,还透露 Opus 5.5 有改善,写作者值得看看。
9月9日
Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails
研究解决了小模型模仿专家时的性能下降问题,提出了新的在线策略修正方法,让小模型在特定任务中更接近大模型表现。
9月7日
8月27日
NVIDIA支持Alibaba Qwen3.8-Flash-Next模型微调
Alibaba Qwen3.8-Flash-Next模型发布,NVIDIA提供微调支持,与TokenSpeed等工具兼容,值得开发者关注。
7月13日
6月12日
6月7日
Fireworks 训练平台扩展,支持 Nemotron 3 Ultra 后训练
Fireworks 把 Nemotron 3 Ultra 的后训练和推理放在同一基础设施上,做模型微调的团队可以直接训练并上线,省去模型迁移的麻烦,值得关注。
5月22日
将智能体工作流编译进LLM权重:成本降低两个数量级,质量接近前沿模型
做智能体编排的团队终于有了低成本替代方案——把工作流写进模型权重而非上下文,成本降两个数量级,质量不掉。做客服、保险、旅行预订自动化的开发者可以直接看论文里的14节点和55节点案例。
5月19日
5月12日