8月20日
23:04
8月13日
17:54
17:54官方账号arXiv cs.LG@Aleksandra Kalisz, Jack Simons, Krisztina Sinkovics, Noam Ghenassia, Shikha Surana, Henry Moss, Paul Duckworth
蛋白质结构预测基础模型在某些靶标上仍不可靠,外部 oracle 可纠正错误但成本高昂。一篇论文系统对比了 FK-steering、DPO、Best K-of-N 和最新提出的 O3 四种预算分配方法。在钙调蛋白(1CLL)和大肠杆菌天冬氨酸转氨甲酰酶(9EEH)两个靶标上,没有单一方法在所有预算下都占优。O3 在低预算时最有效,而 FK-steering 和 DPO 随预算增加表现更好。该研究给出了针对实际 oracle 预算约束的可操作建议。
推荐理由:做蛋白质结构预测的可以看看这篇,它对比了四种 oracle 预算分配方法,告诉你低预算用 O3,高预算用 FK-steering 和 DPO,挺实用。
7月23日
11:29
11:29官方账号arXiv cs.AI@Junyu Dai, Xinyue Fan, Weiqin Li, Xiangang Li, Yunjia Li, Bin Ma, Yukun Ma, Chongjia Ni, Yufei Shi, Haoxu Wang, Menglin Wu, Jianwei Yu, Huaicheng Zhang, Han Zhao, Shengkui Zhao, Haina Zhu
本文提出一个统一的全歌曲生成框架,支持从歌词、文本描述和音乐属性生成完整歌曲。该框架包含四个组件:语义感知分词器将音频编码为8码本RVQ令牌,hybird-LM进行层次化自回归音频令牌建模,FullDiT在连续VAE潜空间中执行流匹配渲染,两级旋律模块用于翻唱生成。在人工分析音乐带歌声排行榜上取得竞争性能,并探索了DPO、GRPO和OPD作为后训练策略。实验在多语言自动基准上进行评估。
推荐理由:这篇论文提出了一个能生成完整歌曲的框架,支持歌词生成、纯音乐和翻唱,还在排行榜上验证了效果,音乐生成方向的同学可以看看。
7月22日
08:52
08:52Fireworks AI@FireworksAI_HQ
精选
MiniMax M3 模型现已可在 Fireworks 上进行训练。用户可通过托管 LoRA SFT 和 DPO 进行标准微调。Fireworks 还提供 Training API,支持自定义 SFT、DPO 和 RL 训练循环,包含检查点、滚动推理和适配器热加载功能。
推荐理由:想 Fine-tune MiniMax M3 的话,Fireworks 现在直接支持 LoRA 和 DPO,还能自定义 RL 训练,省事不少。
6月19日
11:04
11:04官方账号arXiv cs.LG@Haw-Shiuan Chang, Jeffrey Gomez, Mehul Patwari, Aryan Sajith, Hamed Zamani
这篇论文提出利用用户与LLM交互时的鼠标轨迹和眼动数据作为隐式反馈来替代昂贵的显式偏好标注。他们构建了IFLLM数据集,包含59名用户的1336个多轮问答,并记录了鼠标和眼动数据。基于这些隐式反馈训练的奖励模型将文本奖励模型的准确率从55%提升到64%。对8个LLM应用DPO后,响应质量相对提升近3倍,证明了隐式反馈在真实场景中的价值。数据集和代码已开源。
推荐理由:别光看用户点了什么赞,鼠标和眼睛动的方向才是真心话。这篇论文用59人的眼动和鼠标轨迹数据训练奖励模型,准确率从55%飙到64,还开源了数据集。