模型中美对照官方一手06:15VibeThinker-3B: 3B稠密推理模型基于Qwen2.5-Coder-3B发布3B参数就能比肩DeepSeek V3.2和Kimi K2.5,基于Qwen2.5-Coder-3B开源,适合资源受限场景的推理任务。#VibeThinker-3B#Qwen2.5-Coder-3B#DeepSeek V3.2#Kimi K2.52 个信源在谈事件专题官方一手marktechpost@Asif Razzaq3 个信源在谈原文稍后读已读值得跟进有用关注 VibeThinker-3B
论文09:22SFT过度训练导致RLVR下熵崩塌与排名反转这篇论文发现了SFT过训练会搞崩GRPO训练的秘密,还给出了诊断方法来提前止损。做RLHF或强化学习训练的可以看看。#Qwen2.5-Coder-3B#DeepSeek-Coder-6.7B#SFT#RLVRaarXiv: DeepSeek@Siddharth Aphale, Kelly Liu原文稍后读已读值得跟进有用关注 Qwen2.5-Coder-3B
论文精选03:58VibeCoder基于Qwen2.5-Coder-3B,后训练技术带来出色性能Sebastian Raschka分析了VibeCoder的后训练秘诀,基于3B模型就取得惊人成绩,训练顺序和RL方法值得参考。#VibeCoder#Qwen2.5-Coder-3B#推理模型#强化学习官方账号Sebastian Raschka@rasbt原文稍后读已读值得跟进有用关注 VibeCoder