a16z 投资 Preference Model,并开源 RL 环境框架 Karotte
a16z 投了 Preference Model,这家人专门给实验室做 ML 工程的 RL 环境,还把用了一年、跑过百万次评估的框架 Karotte 开源了,做 RL 训练的可以看看。
a16z 投了 Preference Model,这家人专门给实验室做 ML 工程的 RL 环境,还把用了一年、跑过百万次评估的框架 Karotte 开源了,做 RL 训练的可以看看。
Salesforce 这篇论文发现公开 RL 环境大多有奖励错误,还给出 RIVER 筛选方法,8B 模型跑分反超随机采样,做 RL 训练的都该看看。
NVIDIA 把公开 Agent Skills 自动转成 RL 训练环境,产出近 8000 条任务,还开源了流水线思路,做 Agent 训练的可以看看。