全部 AI 动态 · AI 热点

6月27日

15:54

Decoder@Maximilian Schreiner

iLLaDA是ByteDance和中国人民大学联合发布的8B参数扩散语言模型，采用与ChatGPT不同的文本生成方式。在基础性能评估中，iLLaDA的基准水平与Qwen2.5持平，但经过微调后表现落后。该模型展示了扩散方法在语言建模中的潜力，但优化后仍需改进。

AI模型 iLLaDA ByteDance Qwen2.5 扩散语言模型

推荐理由：字节跳动发了新模型iLLaDA，8B参数用扩散方式生成文本，基础性能不输Qwen2.5，微调后稍弱，适合想了解非自回归路线的读者。

原文

6月18日

10:57

arXiv cs.AI@Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou

论文提出MAST方法，在Qwen2.5-Math-1.5B和Qwen3-1.7B-Base上选择性遗忘RLVR诱导的推理，相比全参数更新附带损害更小。MAST通过token级delta-log-probability分析发现SFT-to-RLVR增量与SFT更新差异显著，全参数梯度上升会损害MATH和GSM8K保留性能。MAST基于离主成分能量、更新幅度和遗忘梯度耦合幅度排序注意力投影张量，仅更新前k个子集。在Qwen2.5-Math-1.5B上，MAST使MATH遗忘从45/150降至37/150（McNemar p=0.0078），且GSM8K提升0.8个百分点，MATH保留仅下降0.5个百分点。在Qwen3上，MAST保持GSM8K，而全参数遗忘使其崩溃。

论文 MAST Qwen2.5 Qwen3 推理模型选择性遗忘

推荐理由：这篇论文提出了MAST，一种更精准的模型遗忘方法，在Qwen2.5和Qwen3上只遗忘你想忘的，保留数学能力不掉。适合研究模型编辑或推理安全的同学。

原文

6月16日

20:46

AITOP6月16日 20:46

600亿美元买下Cursor，xAI终于拿到了编程工具，但真正值得跟踪的或许不是AI

10:47

arXiv: DeepSeek@Haolong Qian, Xianliang Yang, Yinuo ma, Lirong Che, Feng Lu, Ye Guo, Lei Song, Jiang Bian, Chun Yuan

论文在Qwen2.5、LLaMA-3和DeepSeek三个系列上发现：用小模型自身生成并通过拒绝采样选取的轨迹，比用更强Oracle模型精炼的高奖励数据，能更有效提升数学推理。Oracle精炼虽修复逻辑，但引入分布偏移，增加小模型适应成本，抵消了逻辑改进的收益。作者提出风格对齐精炼（Style-Aligned Refinement），保留小模型原生轨迹风格同时融入Oracle逻辑修复，降低适应成本并恢复下游效用。该发现挑战了数学推理蒸馏中依赖奖励模型分数选择数据的常规做法。

论文 Qwen2.5 LLaMA-3 DeepSeek 知识蒸馏推理模型

推荐理由：这篇论文揭穿了一个直觉错误：你以为给小白模型喂“学霸笔记”能变强，结果效果还不如它自己瞎写的解题草稿。原因是学霸的思路和它不匹配，硬学反而费劲。

原文

10:41

arXiv cs.LG@Miso Choi, Seonga Choi, Mincheol Kwon, Woosung Joung, Jinkyu Kim, Jungbeom Lee

论文发现，在Vicuna、Qwen2.5、LLaMA2和Mistral等模型家族中，上下文的真实性评分（Truth Scores）在指令微调或多模态适配后高度保留，与其注意头权重继承一致。作者提出TruthProbe软门控策略，通过放大上下文真实头而保留其他头贡献，在HaluEval上提升上下文真实性，并在POPE和CHAIR上减少多模态幻觉。基础LLM的真实头评分有效传递给微调后的LLM和多模态LLM后代。代码已开源。

论文 TruthProbe Vicuna Qwen2.5 多模态幻觉

推荐理由：这篇论文挺有意思，发现模型家族里真实头会继承，搞了个TruthProbe来减少幻觉，效果不错，适合研究模型可解释性和幻觉问题的人看。

原文

6月12日