10:39官方账号arXiv cs.LG@Zhuoyi Yang, Ian G. Harris, Salar Hashemitaheri, Cassie Huang, Yuangang Li, Hyunwoo Oh, Paul Dourish, Tony Givargis, Mohsen Imani, Li Zhang自优化,通常由生成、批判和修订三个阶段组成,是提高LLM生成能力广泛采用的范式。本文对Qwen3和Gemma 3的6个和4个模型大小在不同领域的5个基准上进行了自优化管道的模型大小研究。研究发现,较大的生成器和修订器通常可以提高管道性能,而较小的修订器甚至可能损害性能。此外,性能对批判者的大小高度不敏感,尽管包括一个小的批判者始终优于完全省略批判。结果表明,模型容量不应在自优化管道中均匀分配,不同阶段表现出不同的规模扩展特性,为设计更高效的多元语言模型系统提供了实际指导。论文自优化管道模型大小分配LLM系统1 个信源在谈事件专题推荐理由:这篇论文研究了自优化管道中模型大小分配的影响,发现不同阶段对模型大小的需求不同,为设计更高效的LLM系统提供了新的视角。原文稍后读已读值得跟进有用关注 自优化管道
10:18官方账号arXiv cs.AI@Ramneet Kaur, Pradyumna Chari, Ramesh Raskar, Jugad Singh, Sumit Kumar Jha, Anirban RoyQwen3-0.6B模型在多代理拍卖场景中,通过新框架监测潜在隐蔽协作;该框架对同质化代理的检测准确率达0.993,异质化组合达0.854;测试显示对小范围竞拍者监测负载小,全白盒干预能恢复出价分布并降低合谋行为47.3个百分点。AI模型Qwen3智能体多模态推荐理由:Qwen3推出了VLA框架,用来监测多代理潜在通信,在小范围拍卖里表现好,你可以去了解下。原文稍后读已读值得跟进有用关注 Qwen3
19:32官方一手marktechpost@Sana Hassan精选教程展示了基于XYZ-Aquila-SFT和Qwen3搭建工具调用模型微调流程。内容涵盖轨迹解析、结构化工具调用提取以及Qwen兼容的ChatML渲染。最后使用PyTorch实现LoRA高效参数适配。技巧XYZ-Aquila-SFTQwen3微调推荐理由:想自己做工具调用模型?这篇手把手教你用XYZ-Aquila-SFT和Qwen3微调,从数据到LoRA都有。原文稍后读已读值得跟进有用关注 XYZ-Aquila-SFT
16:26官方一手Pandaily@contact@pandaily.com (Pandaily)中国语音AI创业公司VUI Labs的Luna-TTS模型在Hugging Face TTS Arena排行榜上位列第一,超越了ElevenLabs、MiniMax和Cartesia。在Artificial Analysis的Speech Arena榜单中,Luna-TTS排名第三,领先Google。该模型基于Qwen3的扩散架构,首包延迟仅为41.6毫秒。AI模型Luna-TTSVUI LabsElevenLabs推荐理由:VUI Labs的Luna-TTS登顶语音评测榜,延迟才41.6毫秒,比ElevenLabs还快,搞语音合成的该看看。原文稍后读已读值得跟进有用关注 Luna-TTS
15:18IT之家(博客/媒体)MiniMax于8月14日推出音乐生成模型MiniMax-Music3,可根据歌词和音乐描述生成最长5分钟的完整歌曲。该模型采用分层自回归架构,Global LLM参数规模为8B,基于Qwen3-8B初始化,负责预测第一个RVQ码本;Local LLM参数规模为0.6B,负责预测其余声学码本。输出为32kHz、16-bit立体声WAV文件,官方称能在长音频中保持音乐主题、节奏、歌声身份和编曲推进。AI模型MiniMaxMiniMax-Music3Qwen3推荐理由:MiniMax发布了Music3音乐模型,给歌词和描述就能生成5分钟完整歌曲,前奏副歌桥段都有,比常见几十秒的音乐生成更完整。原文稍后读已读值得跟进有用关注 MiniMax
11:39官方账号arXiv cs.AI@Zichao Yu, Chengzhi Yu, Shengze Xu, Yujin Han, Bingqing Jiang, Xu Wang, Difan Zou精选在线策略蒸馏(OPD)是LLM后训练的核心环节,但存在退化一致性问题:学生通过重复循环获得与教师近乎完美的token一致,但整体回答有缺陷。论文将焦点转向师生不匹配,发现不匹配token分为学生多余和学生缺失两类。提出的TIDE方法采用有界Hellinger整形抑制多余token,并通过教师top-K注入恢复缺失token的概率质量。在Qwen3多个师生对上的数学推理基准中,TIDE优于标准OPD及近期基线,在强不匹配场景下Avg@8从6.9%提升至20.3%,平均响应长度缩短3.6倍。论文TIDE在线蒸馏Qwen3推荐理由:这篇论文讲了个反直觉的事:蒸馏时师生token一致反而可能有害。TIDE方法在数学推理上把准确率从6.9%拉到20.3%,还让回答短了3.6倍,值得做LLM后训练的人看看。原文稍后读已读值得跟进有用关注 TIDE
11:37官方账号arXiv cs.AI@Yubo Jiang, Fengying Xie, Zhiguo Jiang, Haopeng ZhangSKALD 是一种基于策略的自蒸馏框架,使用 Qwen3-Base 模型的两种上下文视图:仅问题的学生和基于抽象技能卡的教师。该方法通过退火指数倾斜目标稳定分布失配,并在验证奖励为正时激活蒸馏。在五个数学基准上,SKALD 在 0.6B、1.7B 和 4B 规模下分别比 GRPO 提升 +2.46、+4.85 和 +12.01 的 avg@8。在 1.7B 规模下,零方差蒸馏恢复 84.7% 的完整增益,且比 FLOP 匹配的 GRPO 高 +4.06。论文SKALDQwen3GRPO推荐理由:想提升数学推理模型?SKALD 把技能蒸馏进权重,比 GRPO 最高涨 12 分,还不用改推理时的输入。原文稍后读已读值得跟进有用关注 SKALD
10:43官方账号arXiv cs.LG@Haoyu Zheng, Yun Zhu, Qing Wang, Wenqiao ZhangTRIAL提出统一回合对齐评分协议,为每个决策回合提取结果视图并比较普通与事后条件下的响应,以有符号对数概率差分配标记级监督。在WebShop和ALFWorld上使用不同骨干模型,TRIAL在全部八种组合中超越GRPO,并在六种组合中达到最优或并列最优。使用Qwen3-1.7B时,WebShop成功率从56.4%提升至75.2%,任务分数从78.7%提升至85.7%。消融实验显示,轨迹相对的回合分配比单纯密集事后蒸馏带来更大提升。论文TRIALGRPOQwen3推荐理由:这个新框架TRIAL能让智能体强化学习更高效,在多个任务上超过GRPO,成功率提升近19个百分点,搞RL的可以看看。原文稍后读已读值得跟进有用关注 TRIAL
12:28官方账号arXiv cs.LG@Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno VasconcelosU-OPSD 提出只用模型自身生成做 on-policy 自蒸馏,不依赖真实标签、环境反馈或更大模型。它通过多次采样后多数投票构造伪答案,并把教师分布建立在最短伪答案上,蒸馏到模型最长错误补全的前缀。在 AIME24、AIME25、HMMT25、MATH500、AMC23 上,U-OPSD 让 Qwen3 4B/8B 非思考模式相对基座提升 8.5%/10.7%,平均超过 OPSD 3.2%/2.3%。思考模式下,U-OPSD 在 4B 超 OPSD 0.9%,8B 持平,并分别超 GRPO 0.7%/1.1%。论文U-OPSDQwen3OPSD推荐理由:不需要标注和外部反馈,U-OPSD靠投票让Qwen3数学成绩再涨一截,追平甚至超过OPSD和GRPO。原文稍后读已读值得跟进有用关注 U-OPSD
11:34官方账号arXiv cs.LG@Yinghui He, Ling Yang, Jiarui Liu, Yongjin Yang, Lechen Zhang, Yingcheng Wu, Zhenfei Yin, Mengdi Wang, Sanjeev Arora论文提出Skill Entropy,用于度量模型在同一推理链中切换不同技能(如先做数学推导再规划日程)的难度。基于558个技能和9个可验证领域构建了Skill^2-Bench基准,任务按技能熵分为三个难度等级。在8个前沿模型和4个开源模型上的测试显示,技能熵越高的任务准确率越低,存在明显的技能切换差距。将Skill Entropy作为训练信号,Skill-Entropy RL在Qwen3-4B-Instruct上将Skill^2-Bench得分从34.4%提升到68.4%,在Qwen3-1.7B上从14.6%提升到40.1%。该训练流程还能直接应用到OpenR1-Math等现有数据上。论文Skill EntropySkill^2-BenchQwen3推荐理由:Skill Entropy能测出模型切换推理技能的短板,还能当训练信号:Qwen3小模型得分从34%飙到68%,也能用在OpenR1-Math数据上。原文稍后读已读值得跟进有用关注 Skill Entropy
09:20官方账号arXiv cs.LG@Jiaming Cheng, Subhransu Das, Rajiv Ramnath多智能体LLM系统中,智能体间通过中继KV缓存而非文本交换信息。论文用错配缓存、清零缓存和矩匹配随机缓存做因果审计,覆盖LatentMAS、KVComm、C2C等系统。在接收方需要发送方私有信息时,主骨干上的相关中继达到100%,无关中继仅23%-25%。在不需要私有信息时,预注册五种子协议在GSM8K、ARC-Challenge、MedQA上显示等效性差异在2.8个点以内。清零中继造成14.7个点下降,而错配缓存仅0.4个点,说明缓存效应不一定来自示例配对。论文KV Cache多智能体Qwen3推荐理由:这篇论文给出了一套错配缓存审计法,对比LatentMAS、KVComm、C2C后发现,基准涨分不等于真在传潜在思维。原文稍后读已读值得跟进有用关注 KV Cache
11:56官方账号arXiv cs.LG@Taekyung Heo, Rasoul Shafipour, Ritchie Zhao, Maximilian Golub, Mohammad Mahdi Kamani, Ritika Borkar, Makesh Tarun Chandran, Pantea Zardoshti, Bita Darvish Rouhani论文提出跨模型KV缓存迁移,让同系列不同尺寸模型切换时直接复用源模型的KV缓存,省去接收方从头预填充。在Qwen3 14B到32B上,单个源层能解释目标键56%的方差、值的32%,多个源层提升到79%和65%。方法用闭式岭回归映射器,基于500条FineWeb-Edu序列(每条1024 token)拟合,并在映射前剥离RoPE以保持位置无关。在三个模型族的六对组合中,四对保留了73%到98%的独立预填充准确率,两对退化严重,用非线性MLP最多挽回37个百分点HellaSwag;映射器比重新预填充快2.7到25倍。论文Qwen3KV缓存跨模型迁移推荐理由:同系列模型切换总得重新预填充?这篇用线性映射传KV缓存,能省2.7到25倍时间,四对组合还保住九成以上准确率。原文稍后读已读值得跟进有用关注 Qwen3
02:38elvis@omarsar0Intology的自动化研究系统Locus对Qwen3基础模型进行后训练,在PostTrainBench上达到SOTA。其训练出的模型超越官方人类调优的Qwen3 1.7B Instruct版本。PostTrainBench用10个H100小时评估代理后训练能力,扩展版PostTrainBench+将预算提升至数千H100小时。在此预算下,Locus后训练的模型集体优于官方Qwen3 1.7B。此外,Locus在Kaggle所有活跃奖金竞赛运行16天后,平均排名第4。AI模型LocusQwen3PostTrainBench推荐理由:Locus这个自动化系统后训练的模型居然干过了人类调的Qwen3 1.7B,在PostTrainBench上拿了第一,还上了Kaggle奖金赛前排。原文稍后读已读值得跟进有用关注 Locus
09:19官方一手arXiv: DeepSeek@Zhoupeng Shou, Xiaodong Hong, Congjing Ren, Jingdai Wang, Yongrong Yang, Zuwei Liao该框架利用大语言模型(如DeepSeek-V4-Flash、Qwen3.7-Plus)模拟工程师工作流,通过闭环响应特征生成并迭代修正PID增益。在100个FOPDT和100个SOPDT测试用例上,托管LLM最终成功率达75-89%和77-79%。对于本地部署的Qwen3-0.6B,监督微调使首次推荐成功率为86.5%,结合物理信息GRPO进一步提高至94.0%,主要改善了首次尝试可靠性和稳定性裕度。论文Qwen3DeepSeekPID整定6 个信源在谈事件专题推荐理由:这篇论文用LLM自动调PID参数,小模型Qwen3-0.6B调参成功率94%,比大模型还稳。原文稍后读已读值得跟进有用关注 Qwen3
12:01官方账号arXiv cs.AI@Haolei Xu, Xiaowen Xu, Haiwen Hong, Zixuan Ni, Hongxing Li, Yiwen Qiu, Weiming Lu, Yongliang Shen提出Relay-OPD方法,解决同策略蒸馏(OPD)中的前缀失败问题:当学生模型进入错误推理方向后,后续生成偏离正确路径。该方法利用教师-学生在失败前缀上的延续不对称性作为无标签触发信号,让教师短暂接管生成然后交回学生训练。使用Qwen3-4B-Instruct-2507作为教师,Qwen3-0.6B/1.7B-Non-Thinking作为学生,在8个数学推理基准上,Relay-OPD在全部基准中取得最佳或次佳结果,1.7B模型平均超越标准OPD 5.73%,超越最强基线FastOPD 1.49%,且训练轨迹长度减少超过50%。论文Relay-OPDQwen3知识蒸馏推荐理由:这篇论文提出了一个很聪明的改进:当学生模型推理跑偏时,让老师模型短暂接管一段,再交回学生继续训练。在Qwen3小模型上效果明显,数学推理准确率提升,训练还更快。原文稍后读已读值得跟进有用关注 Relay-OPD
09:22官方账号arXiv cs.LG@Jiarui Wang, Xiang Shi, Jiaqi Cao, Rubin Wei, Xiquan Wang, Hao Sun, Jingzhi Wang, Zhiqi Yang, Qipeng Guo, Bowen Zhou, Zhouhan LinMemSFT提出一种可插拔的参数化内存模块,用于在不更新骨干网络参数的情况下注入领域知识。该内存通过模仿非参数检索器在领域数据上的行为来习得知识,并可跨不同规模的LLM复用。在生成时,学习到的路由器动态融合内存和骨干网络的输出分布。在生物、地理、法律三个领域,使用Qwen3-8B到Qwen3-235B-A22B的评估显示,MemSFT显著提升领域性能且通用性能几乎无下降,而全参数微调则遭受严重的通用性能遗忘。结果表明,该方法能在参数级别分离通用能力与领域知识。AI模型MemSFTQwen3微调推荐理由:你想微调模型干专业活又怕它变傻?MemSFT加个记忆模块,领域知识涨了,通用能力不掉,比全参数微调靠谱。原文稍后读已读值得跟进有用关注 MemSFT
11:54官方账号arXiv cs.LG@Zeyu Zhang, Xue Li, Iacer Calixto, Paul Groth, Sebastian Schelter该论文通过控制实验比较了Qwen3家族三种匹配器架构(bi-encoder、cross-encoder、generative matcher)、三种模型变体(embedding-oriented等)和三种模型大小,在9个数据集上进行了1215次微调运行。结果显示,embedding-oriented变体对bi-encoder的初始化与表征几何至关重要。cross-encoder始终优于bi-encoder,但更大的模型可缩小这一差距。生成式匹配器仅在分布偏移(如记录模式或跨数据集迁移)下优于cross-encoder。更大的模型更依赖捷径学习,不一定表现更好。论文Qwen3bi-encodercross-encoder推荐理由:想用LLM做实体匹配?这篇论文用Qwen3对比了bi-encoder、cross-encoder和生成式三种架构,告诉你不同场景选什么最靠谱,还公开了代码和实验数据。原文稍后读已读值得跟进有用关注 Qwen3
10:26官方账号arXiv cs.LG@Guoqing Ma在线策略蒸馏(OPD)中教师提供的token级似然度常被局部解读,但本研究发现这种解读受到最终回答正确性的混淆。论文引入一种结果解析诊断方法,交叉评估点状师生分歧与最终答案正确性。在Qwen3-8B学生与Qwen3-32B教师的数学推理实验中,67.84%的响应token属于“同意但失败”(agreement-on-failure);Qwen2.5-7B/32B组合为67.68%。即使教师四轮均正确回答的提示,学生准确率达86.91%,但仍有14.76%的token存在同意但失败。三种训练策略(模仿、遮蔽、对比)均未能显著改善该现象,表明需要过程标签或教师延续等额外位置信息来解决定位局限。论文Qwen3Qwen2.5知识蒸馏推荐理由:论文用实验数据揭示了一个反直觉现象:学生在模仿老师时,67%的token在“同意但失败”,说明局部蒸馏有盲区。做模型蒸馏的朋友可以看看这个诊断方法。原文稍后读已读值得跟进有用关注 Qwen3
11:39官方账号arXiv cs.LG@Rajiv Shailesh Chitale, Rahul Madhavan, Taneesh Gupta, Deepanway Ghosal, Aravindan RaghuveerTTEL是一种利用固定或环境反馈进行token级错误定位的推理时算法。它通过比较条件概率隔离出错步骤,截断并重新生成,复用有效前缀。在Qwen3-8B上,TTEL在LiveCodeBench达到pass@64为71.0%,生成token仅约360.4k,远少于独立采样的735.0k。在AIME-2025和HMMT-2025数学基准上,TTEL也优于其他测试时基线。AI模型TTELQwen3LiveCodeBench推荐理由:TTEL能定位推理错误,只重算出错部分,省近一半计算量。Qwen3-8B在编程测试上成绩亮眼,值得关注。原文稍后读已读值得跟进有用关注 TTEL
12:09官方账号arXiv cs.LG@Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David González-Martínez, Xiaoxia Wu, Yuandong Tian, Shiwei Liu, David Z. Pan, Zhangyang "Atlas" WangISO是一种专门为可验证奖励强化学习(RLVR)设计的优化框架。它通过保持基模型的权重谱不变,仅优化输入输出奇异帧来实现模型适配。离线版本ISO-Merger无需数据或梯度就能合并多个专家模型,在无数据合并方法中性能最强。在线版本ISO-Optimizer在Qwen3-8B-Base上,仅用100步就达到AdamW需270步的准确率(0.495),210步后进一步提升至0.509。实验覆盖1.5B到8B参数的推理与代码任务。AI模型ISORLVRQwen3推荐理由:如果厌倦了RLVR微调慢慢跑,试试ISO:只用1/3的训练步数就能达到同等效果,Qwen3-8B上实测有效,代码开源。原文稍后读已读值得跟进有用关注 ISO
09:47官方账号arXiv cs.LG@Zhihua Liang精选该论文提出一个连续几何框架,将Transformer的离散代数操作建模为语义纤维丛上的积分-微分方程,涉及RMSNorm、RoPE、Softmax Attention等组件。实验覆盖Qwen3、LLaMA-3.1、Gemma-3、GPT-2、Mistral五种架构,参数规模从124M到8B。几何预测与实证一致:Lipschitz缩放校准精度达R²=1.000,且验证了Poincaré递归的热力学抑制、上下文极限相变等六个现象。论文Transformer架构微分几何Qwen3推荐理由:用微分几何重新理解Transformer,给出了注意力机制是薛定谔桥、SGD是违反细致平衡的伊藤扩散等新视角,并有大模型实测验证。原文稍后读已读值得跟进有用关注 Transformer架构
16:06宝玉@dotey精选OpenMOSS 开源了 MOSS-Transcribe-Diarize-0.9B 模型,参数规模 0.9B,支持 128K 上下文,最长可一次处理约 90 分钟音频。该模型采用 Whisper-Medium 编码器 + Qwen3-0.6B 风格 decoder,端到端完成转写、说话人分离和时间对齐,无需级联流程。在单张 4090 显卡上,RTF 为 0.017,5-10 分钟录音约 30 秒转完,并支持热词增强。模型以 Apache 2.0 协议开源,可商用。AI模型OpenMOSSMOSS-Transcribe-Diarize-0.9BWhisper推荐理由:OpenMOSS 开源了一个 0.9B 参数的端到端模型,能一次搞定 90 分钟多人音频,告诉你谁说了什么、什么时候说的,单卡 4090 跑得飞快。原文稍后读已读值得跟进有用关注 OpenMOSS
09:15官方一手marktechpost@Sana Hassan精选该教程展示了如何在Google Colab单GPU上使用NVIDIA NeMo AutoModel微调Qwen3-0.6B模型。从验证CUDA硬件开始,安装NeMo AutoModel源码,加载官方LoRA配置。在受限运行时调整精度、批次大小、检查点和调度器设置。通过automodel CLI启动微调,加载LoRA检查点后比较基础模型与微调输出的差异。最后演示NeMoAutoModelForCausalLM Python API的使用。技巧Qwen3LoRANeMo AutoModel2 个信源在谈事件专题推荐理由:教你用Colab单GPU跑Qwen3-0.6B的LoRA微调,全程实操,从环境配置到API调用都有,适合想上手NeMo的低资源玩家。原文稍后读已读值得跟进有用关注 Qwen3
15:21宝玉@dotey精选Whisper 在字幕翻译中存在时间戳不准、中英文混排支持差、不直接支持发言人识别等问题。Qwen3-0.6b ASR 搭配 Qwen3-ForcedAligner 模型可精准对齐词级时间戳,本地运行资源占用低。发言人识别可使用 Pyannote + WeSpeaker 开源模型,结合 Agent 上下文提升准确率。若要求高,可选用火山引擎豆包录音文件识别模型 2.0。宝玉在 BaoCut App 开发中,通过 Claude Code 和 Opus 4.8 等模型实现原型设计到功能实现的高效循环。技巧Qwen3WhisperASR推荐理由:宝玉分享了用 Qwen3 ASR 替代 Whisper 做字幕的心得,时间戳对得很准,还配了发言人识别方案,适合搞视频翻译的朋友。原文稍后读已读值得跟进有用关注 Qwen3
11:21阮一峰的网络日志(博客/媒体)精选RTX 5090有32GB显存和1792GB/s带宽,但无法加载70B参数模型(需32.6GB)。AMD Strix Halo迷你PC(Ryzen AI Max+ 395)拥有128GB统一内存和256GB/s带宽,能加载大模型但Token生成速度仅每秒6个。MoE模型如Qwen3-30B-A3B每次只激活3B参数,可将读取量降至2GB,从而在迷你PC上达到每秒100+ Token。选择硬件需根据模型大小和速度需求权衡。技巧RTX 5090AMD Strix Halo统一内存推荐理由:想在家跑AI大模型?这篇对比了RTX 5090和AMD迷你PC,解释了为什么统一内存能装大模型但速度慢,还教你用MoE模型提速。原文稍后读已读值得跟进有用关注 RTX 5090
11:20官方账号arXiv cs.LG@Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge, Hao Cheng, Mike Hang Wang, Jianfeng Gao, Sharon LiTRACE是一种密集信用分配方法,用于代理强化学习,通过冻结参考模型获取黄金答案的log概率,转化为log比值状态值,并利用时间差分变化推导每动作奖励。在长程复杂搜索中,该方法无需冷启动监督微调或中间训练,即可显著提升基础模型工具使用能力。在封闭网络BrowseComp-Plus基准上,TRACE将Qwen3-4B从7.2提升至35.6,将Qwen3-30B-A3B从8.4提升至42.6。学习曲线显示RL训练期间更快改进和收敛。论文TRACEQwen3BrowseComp-Plus推荐理由:想解决Agent长程任务奖励稀疏问题?看TRACE方法,无需额外批评器,用TD变化给每步打分,Qwen3在BrowseComp-Plus上从7分直接跳到35分。原文稍后读已读值得跟进有用关注 TRACE
09:52berryxia@berryxia作者基于Qwen3模型进行2bit量化,得到Ternary-bonsai-27b-mlx-2bit模型。在M1 Pro 32G笔记本上通过LM Studio加载并开启本地服务器,直接接入业务产品。回答速度较快,多模态功能表现良好,无大问题。技巧Qwen3Ternary-bonsaiLM Studio推荐理由:给想低成本跑大模型的开发者参考:用Qwen3量化版,M1 Pro就能流畅做本地任务。原文稍后读已读值得跟进有用关注 Qwen3
09:22官方账号arXiv cs.AI@Roman Prosvirnin, Victor Minchenkov, Alexey Soldatov, Vladimir Bashun该论文提出JADR(Jacobian Assessment of Danger Recognition)协议,利用Jacobian空间(J-space)在模型生成第一个token前衡量其危险识别能力。协议将每个层级的top-k J-space tokens映射到6个行为轴,并使用StrongREJECT构建危险样本、XSTest和OKTest构建安全对照。方法不依赖外部裁判模型,完全在模型激活上本地运行。研究者测试了Qwen3-1.7B、Qwen3-4B、Qwen3-8B、Qwen3-Uncensored-4B、Qwen3-SafeRL-4B和Gemma 2 9B共6个模型在BF16、INT8、INT4三种量化精度下的表现,使用SafetyAUC指标及bootstrap置信区间进行统计比较。结果能显著区分模型内部安全机制的强弱并揭示不同量化带来的差异。论文Qwen3Gemma 2JADR推荐理由:JADR协议能从模型内部直接测出危险识别能力,不用外部裁判,还能对比Qwen3和Gemma 2在不同量化下的安全表现,挺实用。原文稍后读已读值得跟进有用关注 Qwen3
09:11官方账号arXiv cs.LG@Xingyu Dang, Haocheng Tang, Junmei Wang, Yanjun Li研究团队构建了大规模反应机理推理数据集,并创建了FukuyamaBench基准,该基准源自Fukuyama的《高级有机反应机理》一书,用于评估模型的分层机理推理能力。微调后的Qwen3-30B-A3B模型在FukuyamaBench Set A上达到8.3%的精确路径匹配率,超过专用FlowER模型的5.1%。结果表明机理感知训练可显著增强语言模型的化学推理能力。AI模型Qwen3FlowER化学反应推荐理由:Qwen3微调模型在化学机理推理上直接击败了专用FlowER,准确率从5.1%提升到8.3%,化学和AI交叉领域值得一看。原文稍后读已读值得跟进有用关注 Qwen3
13:56官方账号vLLM@vllm_project精选76°AMD团队将ROCm支持引入vime,vime是vLLM生态的RL后训练框架,端到端RL后训练现在原生运行在AMD Instinct MI355X GPU上。vime使用vLLM作为rollout后端,在ROCm上继承完整vLLM栈,无需独立代码路径。AMD验证了pipeline并上游了ROCm修复,提供了预构建容器。支持GRPO训练、colocated和非colocated训练/rollout、Megatron-LM训练+vLLM rollout、Qwen3密集和MoE模型。在MI355X上,Qwen3-8B达到约4100 tokens/gpu/s,训练-rollout logprob差异低且稳定。AI产品AMDROCmvime推荐理由:AMD给vLLM生态的RL训练框架vime加了ROCm支持,现在你的Qwen3-8B在MI355X上能跑到4100 tokens/gpu/s,训练和rollout的logprob很稳,还直接提供预构建容器,省去编译麻烦。原文稍后读已读值得跟进有用关注 AMD
10:12官方账号arXiv cs.LG@Vladislav BeliaevAgon是一种竞争性跨模型强化学习方法,两个模型互为评分器,无需过程标签或奖励模型。在DeepMath硬数据集中使用Qwen3基准,Agon的pass@1达到GRPO的两倍。该方法通过交替角色训练,使模型逐步面对更强的对手。在Qwen3.5和Gemma 4等模型家族的编程代码任务上也验证了有效性。论文AgonQwen3Gemma 4推荐理由:Agon让两个模型互相打分比赛,推理能力直接翻倍,比GRPO强一倍,而且完全不需要人工标注过程标签。原文稍后读已读值得跟进有用关注 Agon
09:54官方账号arXiv cs.LG@Vladislav Beliaev精选AdaPrefix-GRPO针对GRPO在困难问题上梯度消失的问题,提出自适应调整正确前缀长度的机制。方法通过反馈控制器将问题的成功率维持在50%附近以最大化梯度信号,训练后完全移除前缀。在0.6B模型上,该方法在保留训练分布的难题上将准确率提升2.1倍;在Qwen3-1.7B上提升1.6倍,在AIME基准上提升1.7倍,同时将追踪长度减半。模型越小,增益越大。论文AdaPrefix-GRPOGRPOQwen3推荐理由:这篇论文解决了GRPO训练时难问题学不到东西的痛点,用自适应前缀让模型在数学推理上准确率翻倍,而且模型越小效果越明显,值得做强化学习的人看看。原文稍后读已读值得跟进有用关注 AdaPrefix-GRPO
17:00@koltregaskes@koltregaskes精选分析显示,前沿模型发布到可本地运行的类似开源模型平均滞后25个月。例如GPT-3到Llama 2 70B约37个月,GPT-4到Gemma 3/Qwen3约2年,Claude 3.5 Sonnet到Gemma 4 31B约21个月。趋势预示当前前沿能力可能在两年后出现在笔记本电脑级模型中。该图表预测Fable/Mythos级模型约2028年中出现。AI模型GPT-3Llama 2GPT-41 个信源在谈事件专题推荐理由:想了解前沿模型多久能变成你能在笔记本上跑的开源版?这篇用GPT-4、Claude 3.5等具体案例算出了平均25个月的滞后,还画了未来预测图。原文稍后读已读值得跟进有用关注 GPT-3
11:41官方账号arXiv cs.AI@Shiyuan Feng, Huan-ang Gao, Haohan Chi, Hanlin Wu, Zhilong Zhang, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao ZhouRLVR通过可验证奖励提升推理能力,但每次训练强模型需要大量采样,成本高昂。Direct-OPD方案在小模型上执行RL,将其策略偏移作为隐式奖励传递给强模型。对比后RL教师与前RL参考的对数比率,为学生模型提供密集监督。实验显示,Direct-OPD将Qwen3-1.7B在AIME 2024上的准确率从48.3%提升至62.4%,仅需8块A100 GPU训练4小时。该方法优于step-matched直接RL,并支持多策略偏移的级联组合。论文Direct-OPDQwen3AIME 2024推荐理由:用弱模型训练强模型,Qwen3-1.7B在AIME 2024从48.3%飙到62.4%,只花4小时8卡A100。比直接RL还省,值得试试。原文稍后读已读值得跟进有用关注 Direct-OPD
11:54官方账号arXiv cs.AI@Wentao Zhang, Liliana Hotsko, Woojeong Kim, Pengyu Nie, Stuart Shieber, Yuntian Deng精选PAW(Program-as-Weights)提出一种模糊函数编程范式,将自然语言规范编译为紧凑的本地可执行神经构件。一个4B编译器在FuzzyBench(1000万示例)上训练,为冻结的0.6B Qwen3解释器生成参数高效适配器。该解释器执行PAW程序,性能匹配直接提示Qwen3-32B,但推理内存仅为其1/50,在MacBook M3上达30 tokens/s。PAW将基础模型从逐输入求解器转变为可复用小工具构建器。AI模型PAWQwen3FuzzyBench推荐理由:PAW让模糊函数(如日志告警、修复JSON)不再依赖大模型API。用4B编译器一次编译,0.6B小模型就能跑出32B的效果,还省内存和算力。原文稍后读已读值得跟进有用关注 PAW
11:52官方账号arXiv cs.AI@Yanjun Zhao, Ruizhong Qiu, Tianxin Wei, Yuanchen Bei, Zhining Liu, Lingjie Chen, Ismini Lourentzou, Hanghang Tong, Jingrui HeReContext是一种无需训练的长上下文推理方法,通过模型内部相关性信号构建证据池并在生成前重放。该方法在8个长上下文数据集上测试,上下文长度达128K。实验表明,ReContext在Qwen3-4B、Qwen3-8B和Llama3-8B三个模型上均提升了证据利用率,平均排名最优。AI模型ReContextQwen3Llama3推荐理由:ReContext不用训练就能让模型用上长文里的关键信息,Qwen3和Llama3上都有效,适合处理超长文档推理。原文稍后读已读值得跟进有用关注 ReContext
12:35官方账号arXiv cs.LG@Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong本文基于Qwen3和Qwen2.5共7个模型,使用GRPO、GiGPO、Dr. GRPO三种RL算法,在数学推理、代码生成和智能体决策任务上实验。研究发现训练单层Transformer即可恢复全参数RL训练大部分甚至全部改进。作者引入“层贡献”指标量化单层训练相比全参数训练的收益比例。结果显示RL收益高度集中于少数中间层,输入输出层贡献显著较低。论文Qwen3GRPOTransformer推荐理由:这篇论文发现RL训练只需调优一层Transformer就能接近全参数效果,还揭秘中间层才是关键,刷新认知。原文稍后读已读值得跟进有用关注 Qwen3
10:07官方账号arXiv cs.LG@Aryo Pradipta Gema, Beatrice Alex, Pasquale Minervini精选论文提出 LOCOS(Logit-Contribution Scoring),一种写感知的注意力头检测方法。在 Qwen3、Gemma-3、OLMo-3.1 三个模型家族上,平均消融 LOCOS 选出的 top 头后,在 NoLiMa 非字面检索基准上 ROUGE-L 下降比之前基于注意力的检测方法更快。以 Qwen3-8B 为例,消融 50 个头使 ROUGE-L 从 0.401 降至 0.000,而最强基线仍保留 0.292。同一消融在 MuSiQue 上从 0.55 降至 0.08,在 BABI-Long 上从 0.62 降至 0.20,而随机头消融偏差在 0.05 以内。所选头是检索专用的,参数回忆和算术推理保持在基线水平。论文LOCOSQwen3Gemma-3推荐理由:这篇论文告诉你怎样用 LOCOS 找出模型里真正干活的注意力头,在长上下文检索任务上效果拔群,比旧方法准很多。原文稍后读已读值得跟进有用关注 LOCOS
09:59官方账号arXiv cs.LG@Jason R. Brown, Patrick Leask, Lev McKinney该论文系统研究了语言模型微调时的突现错位现象。作者在Qwen3家族多个模型上实验,发现优化器选择造成7倍的对齐率差异,而模型规模(1B-235B)影响可忽略。Muon优化器通过隐式正则化使LoRA适配器的奇异值分布更均匀,从而最好地保持对齐。额外添加谱正则化损失项可显著恢复Adam和Lion等易错位优化器的对齐性能。论文Qwen3MuonAdam推荐理由:这篇论文告诉你:选对优化器能把模型对齐率差7倍,Muon比Adam更靠谱,还能用谱正则化补救。原文稍后读已读值得跟进有用关注 Qwen3
11:14官方账号arXiv cs.LG@Aaryam Sharma推测解码利用快速起草器生成候选 token,再由大模型验证以加速推理。现有理论主要针对随机采样,而实用系统多用贪婪解码和松弛接受规则。本文提出一类具有拒绝区域的接受准则,并给出其精确 KL 散度下界,覆盖严格贪婪、加性和乘性松弛、top-(m) 以及熵阈值等情形。对于树形解码,推导出目标贪婪 token 仍被起草器 top-(m) 覆盖的充分条件。在 Qwen3 模型上的实验表明,松弛和树形准则显著扩大了可保证接受的区域。论文Qwen3speculative decoding推理模型推荐理由:这篇论文搞明白了推测解码里那些花式接受规则到底行不行,给出了数学保证,还在Qwen3上验证了,搞推理加速的值得一看。原文稍后读已读值得跟进有用关注 Qwen3