11:21官方账号arXiv cs.AI@Ananya Sahu, Mohit Bansal, Elias Stengel-EskinCreativeInstruct是一种可扩展的指令微调方法,通过让模型学习注入[StartCreativity]标记来平衡创造性与后训练质量。该方法引入基于图编辑距离的结构多样性指标,捕捉叙事层面的变化。在叙事生成任务中,CreativeInstruct匹配或超过了多模型基线及蒸馏变体的多样性,且无需牺牲质量。人工评估中,70.3%的评分者认为CreativeInstruct的生成比后训练模型更有创造力。将GRPO应用于CreativeInstruct检查点,在AMC上提升约4%,在MATH上提升约5个百分点。论文CreativeInstructGRPO指令微调推荐理由:CreativeInstruct用特殊标记让模型在保持质量的同时更会编故事,人类测评七成认为更有创造力,还能给强化学习带来几个点的提升。原文稍后读已读值得跟进有用关注 CreativeInstruct
09:23官方账号arXiv cs.LG@Ku Onoda, Paavo Parmas, Hiroki Furuta, Soichiro Nishimori, Yuta Oshima, Shohei Taniguchi, Yutaka Matsuo文本到图像模型如SD3.5-M对同一提示常生成有限视觉模式的图像,加剧人口统计偏斜。论文形式化目标为target-mode覆盖,提出多轴Max@K强化学习目标。该方法对每组样本取每个类别的最大分数并求和,分配正权重仅当样本提升该类别的组最大值。在SD3.5-M上使用确定性颜色奖励验证信用分配机制后,在三个自动评估器上公平性分数相对于基础模型提升0.23-0.36,同时保持图像质量和文本对齐。论文SD3.5-M文本到图像生成公平性推荐理由:这篇论文用多轴Max@K强化学习,让T2I模型生成更公平多样的人像,公平分提升0.23-0.36,不牺牲质量。原文稍后读已读值得跟进有用关注 SD3.5-M
13:17官方账号arXiv cs.AI@Sara Dorfman, Maya Vishnevsky, Omer Dahary, Or Patashnik, Daniel Cohen-Or该论文提出一种名为Semantic Browsing的方法,解决文本到图像模型生成样本多样性不足的问题。传统方法依赖随机噪声产生无意义变化,而Semantic Browsing通过Vision Language Model(VLM)在文本层面施加结构化语义变异。用户可沿可解释的语义轴(如物体属性、场景布局)导航图像集,每个变体对应一个具体可理解的语义决策。实验表明该方法能生成多样且可浏览的设计空间。论文Semantic Browsing文本到图像Vision Language Model推荐理由:想要生成同一主题下不同设计的图像?这篇论文教你用VLM在文本层面控制多样性,比随机抽噪声靠谱多了。原文稍后读已读值得跟进有用关注 Semantic Browsing
10:25官方账号arXiv cs.AI@Anthony GX-Chen, Ankit Anand, Gheorghe Comanici, Zaheer Abbas, Eser Aygün, David Smalling, Shibl Mourad, Doina Precup, André Barreto, Mark Rowland经典强化学习追求确定性策略以最大化标量奖励期望,但在语言模型微调或科学发现等现代应用中,多样性至关重要。现有方法如熵正则化或多样性奖励常需脆弱权衡,牺牲性能换取随机性。本文提出将奖励函数视为分布而非标量,通过非线性的动作集目标函数,使校准的行为多样性自然涌现,且不牺牲期望奖励。在上下文赌博机设定下,推导了原则性的梯度估计器,证明该框架泛化了策略梯度与动作集方法。实验表明,该方法为需要行为广度的复杂RL任务提供了稳健的理论替代方案。论文强化学习多样性奖励不确定性推荐理由:做RL研究或语言模型微调的团队,如果正为多样性-性能权衡头疼,这篇论文给出了一个理论干净的新框架——把奖励不确定性当作多样性来源,不用额外调参。值得细读。原文稍后读已读值得跟进有用关注 强化学习