11:21官方账号arXiv cs.AI@Ananya Sahu, Mohit Bansal, Elias Stengel-EskinCreativeInstruct是一种可扩展的指令微调方法,通过让模型学习注入[StartCreativity]标记来平衡创造性与后训练质量。该方法引入基于图编辑距离的结构多样性指标,捕捉叙事层面的变化。在叙事生成任务中,CreativeInstruct匹配或超过了多模型基线及蒸馏变体的多样性,且无需牺牲质量。人工评估中,70.3%的评分者认为CreativeInstruct的生成比后训练模型更有创造力。将GRPO应用于CreativeInstruct检查点,在AMC上提升约4%,在MATH上提升约5个百分点。论文CreativeInstructGRPO指令微调推荐理由:CreativeInstruct用特殊标记让模型在保持质量的同时更会编故事,人类测评七成认为更有创造力,还能给强化学习带来几个点的提升。原文稍后读已读值得跟进有用关注 CreativeInstruct
11:59官方账号arXiv cs.LG@Yu-Cheng Shi, Zhen-Hao Xie, Jun-Tao Tang, Da-Wei Zhou多模态大语言模型(MLLMs)通过指令微调表现出色,但实际部署需要持续获取新的视觉语言能力,因此多模态持续指令微调(MCIT)至关重要。现有方法常采用稀疏架构(如混合LoRA专家)通过图像-文本相似度路由,但任务响应结构不同时可能共享高度相似的语义,导致路由错误和梯度干扰。ProtoAda提出格式感知的任务原型,将任务分配与路由对齐到语义和输出结构,并通过几何感知方式整合格式兼容的更新,有效重用和优化现有参数。实验表明,ProtoAda在多个基准上表现优异,尤其对答案结构易被顺序微调破坏的任务效果显著。论文多模态大语言模型持续学习指令微调推荐理由:做多模态持续学习的团队终于有了解决任务路由混乱的方案——ProtoAda通过原型感知输出结构,避免VQA和接地任务互相污染,建议关注论文中的几何整合细节。原文稍后读已读值得跟进有用关注 多模态大语言模型
10:42官方一手arXiv: DeepSeek@Md. Asaduzzaman Shuvo, Mahedi Hasan, Md. Tashin Parvez, Azizul Haque Noman, Md. Shafayet Hossain Ovi精选多语言大模型在处理孟加拉语等低资源语言时,常因文化语境缺失导致敬语使用错误。研究者构建了BLADE数据集,包含4196个精心设计的对话对,用于指令微调。通过LoRA适配器对DeepSeek-8B和LLaMA-3.2-3B进行参数高效微调,模型在结构保真度和敬语对齐上显著提升。该工作为低资源多语言生成中的语用鸿沟提供了基准。代码和数据集已开源。论文多语言模型孟加拉语敬语对齐推荐理由:做低资源语言NLP或文化敏感对话系统的团队,这个数据集直接解决了敬语对齐的痛点,可以拿来微调自己的模型试试。原文稍后读已读值得跟进有用关注 多语言模型