论文13:47RL 框架将神经网络编辑转化为强化学习问题这个框架让做模型微调或安全对齐的团队省去手动设计编辑算法的时间,直接用 RL 学习策略就能完成偏见缓解或遗忘任务,值得关注。#强化学习#模型编辑#偏见缓解#机器遗忘aarXiv cs.LG@Shaivi Malik原文稍后读已读值得跟进有用关注 强化学习