10:18官方账号arXiv cs.AI@Zhu Zhang, Jixun Wang, Xiaoang Xu, Xiaorong Wang, Zihan Zhou, Zhiyuan Wang, Shuo Wang, Chaojun Xiao, Yuezhi Zhou长语境推理任务中,传统策略蒸馏存在教师支持偏差导致效果下降问题。该研究提出GC-OPD组校准策略,对Qwen3-4B等模型优化后,在五个长语境基准测试中表现提升。应用该策略后,Qwen3-8B模型的平均得分从35.12提升至44.65,验证了方法有效性。论文Qwen3-4BQwen3-8BLong-Context推荐理由:SolereZhang团队推出的GC-OPD方法,用于优化Qwen系列大模型完成长语境任务,比传统方法效果更好,值得尝试一下。原文稍后读已读值得跟进有用关注 Qwen3-4B
11:23官方账号arXiv cs.AI@Adel ElZemity, Shujun Li, Budi Arief论文测试了11个开源小语言模型(SLM)、3个网络安全预训练模型和6个前沿大语言模型(LLM)在Meta的CyberSecEval恶意软件分析基准上的表现。设计了四种编排架构:多智能体管道、对抗性辩论、层级咨询和混合系统。混合系统(Qwen3-4B与Foundation-Sec-8B)达到35.30%准确率,超过最强网络安全基线22.54%和最强无基线前沿模型34.77%。有证据的Gemini达到38.22%,表明证据导向的编排可显著提升协作SLM的性能。论文Qwen3-4BFoundation-Sec-8BCyberSecEval推荐理由:别总盯着大模型花钱了,用Qwen3-4B和Foundation-Sec-8B组队就能干翻GPT,这篇论文给了具体方法和数据。原文稍后读已读值得跟进有用关注 Qwen3-4B
10:08官方账号arXiv cs.AI@Difan Jiao, Raghav Singhal, Robert West, Ashton AndersonTandem Reinforcement Learning (TRL) 将 tandem 训练范式引入带可验证奖励的强化学习(RLVR)。TRL 让一个较强的 senior 模型与一个冻结的 junior 模型随机交替协作生成推理过程,对最终结果给予奖励,并对 senior 应用标准 GRPO 损失。在 Qwen3-4B-Instruct 上使用竞赛数学训练,TRL 的 solo 推理能力与 vanilla GRPO 持平,但同时提升了 senior 与 junior 的交接鲁棒性、减少了 junior 侧分布漂移,并产出了对 junior 更易理解的思维链。该工作为多模型通信与人类兼容性提供了实际收益的路径。AI模型TRLQwen3-4BGRPO推荐理由:他们提出了 TRL,让强模型和弱模型组队推理,强模型学会写弱模型能看懂的推理过程。训练 Qwen3-4B 后,单打能力不降,协作能力更强。原文稍后读已读值得跟进有用关注 TRL
15:10官方账号LMSYS Org (SGLang)@lmsysorg精选71°SGLang-Omni 现已支持 MOSS-TTS-Local Transformer v1.5 模型。该模型基于 Qwen3-4B 骨干,可生成 48kHz 立体声语音。支持零样本语音克隆和原生流式,覆盖 31 种语言,训练数据约 400 万小时。非流式场景下达到 5.976 req/s,RTF 0.644,WER 1.75%(SeedTTS English,2×GPU)。采用三阶段管线:参考编码、AR 引擎、流式声码器。AI模型MOSS-TTSSGLang-OmniQwen3-4B推荐理由:SGLang-Omni 刚上线 MOSS-TTS v1.5,开源、零样本克隆声音,支持31种语言,速度也不错,玩玩看。原文稍后读已读值得跟进有用关注 MOSS-TTS