#模型蒸馏
这篇论文测试了让智能体自己动手省钱:让 Opus 5 等模型把任务封装成小程序或小模型,成本能降 657 倍但多数尝试会翻车,结果挺有意思。
中国团队靠几千个转售商白嫖 Claude 蒸馏模型,Anthropic 一封他们就开空壳公司,猫鼠游戏看个明白。
Replit CEO Amjad Masad 提了个有意思的思路:通用 Agent 干活时发现自己只被用来干一种活,就顺手训练个小模型顶替自己,便宜又更安全,像 JIT 编译器。
Replit 老板聊了个有意思的想法:大模型发现自己干不完的活,当场训练个小模型接班,还更省钱更安全,听完对选智能体架构会有启发。
这篇论文提出了一种新的模型蒸馏方法γOPD,它通过引入折扣时间信用分配来平衡长时程监督和优化稳定性。实验表明,该方法在数学和代码推理任务上,比现有方法有更稳定的提升效果。
Cohere 拿学生 Transformer 玩梗,Aidan Gomez 接话说要复活 Google Brain,这俩人到底在暗示啥,点开视频不就知道了。
Miles 发布了 OPD 方法,让 Qwen3.5 模型推理更快更准,无需任务奖励,比传统蒸馏更高效,适合模型压缩场景。
DeepSeek API 可能偷偷调用 Claude?测试者用 3D 游戏、安全题等挖出异常行为,但证据还不铁,吃瓜注意别上头。
纳德拉公开怼OpenAI和Anthropic,说他们一边拿公开数据训练,一边不让别人蒸馏自己的模型,挺双标。微软还顺便推销自家产品。
Anthropic刚发的Claude Opus 4.8被揭套壳千问和DeepSeek,转头就告阿里偷模型,马斯克都看不下去了,这瓜绝对值得吃。
这篇论文用DeepSeek-V4-Flash生成了上万条验证过的Polkit规则,并通过消融实验证明结构化上下文不是锦上添花,词汇表才是提升语义质量的关键。