10:47官方账号arXiv cs.AI@Yucheng Jiang, Zora Zhiruo Wang, Ruishi Chen, Diyi Yang自然计算机使用痕迹是获取日常工作模型的有价值资源。TMI方法能够发现未约束痕迹中的潜在任务,并为每个潜在任务诱导一个任务模型,包括递归目标分解的层次目标模型和控制流程的流程模型。TMI在控制的人类和代理轨迹上,与真实分组有0.974的一致性,并重建了74.9%的观察到的执行步骤。技能提升使任务准确率比最强基线高30.0%论文任务模型诱导计算机使用痕迹递归目标分解推荐理由:TMI方法能够从计算机使用痕迹中诱导出任务模型,为任务执行提供更准确的指导,比现有方法更有效原文稍后读已读值得跟进有用关注 任务模型诱导
10:05官方账号arXiv cs.LG@Alexander Rombach, Chantale Lauer, Nijat Mehdiyev这篇论文研究了奖励函数设计对基于强化学习(RL)的流程模型生成质量的影响。研究者使用Llama 3.1 8B和Qwen 2.5 14B两个模型家族,在48种配置下训练,评估框架包含38个句法、语用和语义指标。实验发现RL能同时提升语用和句法质量,输出变异性降低6倍以上。等权重奖励始终优于定向加权,后者可能导致模型崩溃。设计选择与模型架构存在非平凡交互,例如无效惩罚对Llama 3.1必要但对Qwen 2.5无关。论文RLBPMNLlama 3.1推荐理由:想知道怎么给LLM设计奖励函数来提升生成质量?这篇论文用38个指标和两个模型做了系统对比,结论很具体。原文稍后读已读值得跟进有用关注 RL