09:31官方账号arXiv cs.AI@Wentao Liu, Siyu Song, Xi Chen, Youjia Li, Xiaokun Wang, Min Ji, Ji WangAnthroDial是一个闭环框架,将拟人对话的生成、评估和偏好对齐联合建模。其运行时结合角色条件调度、长时记忆和虚拟时间;评测包含L0有效性门控、5个每轮维度和5个对话级维度。后训练管线用16,436个调度决策示例做SFT,并采用GRPO与认知诊断ZPD感知奖励,通过Kalman滤波对每个行为维度进行能力估计并加权。在55个角色、50个场景、50个角色-场景绑定、每模型100个角色条件案例的基准上,评估了16个系统,Qwen3.6-27B-SFT+RL达到39.00%严格ACC和98.5总分。9B无思考设置下,SFT和RL将严格ACC从0.00%提升到13.00%和18.37%。论文AnthroDialQwenGRPO推荐理由:这篇论文把拟人对话的生成、评测和奖励对齐做成闭环,Qwen3.6-27B微调后严格准确率39%,比基线高一大截。原文稍后读已读值得跟进有用关注 AnthroDial