11:24官方一手arXiv: DeepSeek@Zhongchao Zhou, Yixuan Xie, Wenwei Yu, Yuxi Lu, Yaonan Zhu, Qian Niu, Yutaka Matsuo, Yusuke Iwasawa精选论文提出CoDyControlBench基准,包含132个系统配置,覆盖自由度、系统类型、耦合度等五个维度。评估了GPT、Gemini、Claude、GLM、DeepSeek、Qwen六款模型,GPT设计成功率最高达94.8%,Qwen最低为50.0%。分析显示自由度与控制器类型对成功率影响最大,差距主要来自增益选择与瞬态限制机制。通过推理蒸馏得到1.5B参数模型,在基准上胜过答案蒸馏模型,并在气动人工肌肉机械臂的三次物理试验中全部成功跟踪目标。论文CoDyControlBenchGPTQwen推荐理由:论文搞了个新基准CoDyControlBench,测了6款模型,GPT成功率最高94.8%,还蒸馏出1.5B小模型能上机械臂干活。原文稍后读已读值得跟进有用关注 CoDyControlBench
11:58官方账号arXiv cs.LG@Dongjie Fu, Di Cao, Xize Cheng, Zihan Zhang, Wenxu Jia, Yifu Chen, Shengpeng Ji, Yu Zhang, Tao JinX$^3$-OPD是一个跨模态策略蒸馏框架,将文本教师模型的推理能力迁移到音频语言学生模型上。训练时学生基于自身声学感知生成推理轨迹,教师用匹配文本和验证答案提供词级指导。框架构建了三层对称语料:文本推理合成语音、复杂声场音频事件推理、含副语言线索的会话推理。在MMSU、MMAU、BIG Bench Audio和MMAR基准上,X$^3$-OPD显著提升了音频推理和思维链质量,且保持了模型在领域偏移下的现有能力。AI模型X$^3$-OPD大型音频语言模型推理蒸馏推荐理由:想提升音频模型的逻辑推理?这个框架用文本教师蒸馏,在MMSU等基准上效果拔群,比纯音频训练强很多。原文稍后读已读值得跟进有用关注 X$^3$-OPD
10:27官方账号arXiv cs.AI@Zehua Cheng, Wei Dai, Jiahao Sun大型语言模型存在捷径学习问题,在分布外输入上系统性失败,即使逻辑结构相同。本文提出不变梯度对齐(IGA)框架,通过逻辑同构集、连续梯度冲突掩码和截断SVD投影三个创新,对齐语义多样但逻辑同构样本的梯度更新。理论上,IGA比经验风险最小化(ERM)有更紧的分布外泛化界;实验上,在四个基准上准确率提升最高14.3个百分点,逻辑一致性分数提升四倍。该方法适用于知识蒸馏场景,帮助小模型学习更鲁棒的推理能力。论文推理蒸馏分布外泛化梯度对齐推荐理由:做推理蒸馏或知识迁移的团队,IGA解决了小模型在分布外数据上泛化差的痛点,逻辑一致性提升四倍,值得在数学、医学等跨领域任务上试试。原文稍后读已读值得跟进有用关注 推理蒸馏