12:00向阳乔木@vista8RLHF(基于人类反馈的强化学习)是一种让模型对齐人类偏好的训练方法。它先收集人类对模型输出的偏好比较,训练一个奖励模型,再用强化学习(如PPO)更新语言模型。该技术是ChatGPT等对话模型能力的关键来源之一。技巧RLHF强化学习训练方法推荐理由:一条视频就讲清楚了RLHF的原理和流程,适合想搞懂AI训练机制的朋友。原文稍后读已读值得跟进有用关注 RLHF
16:39IT之家(博客/媒体)Anthropic 通过数据标注公司 Snorkel AI 的“Marlin”项目,雇佣约 1000 名人类软件工程师来微调 Claude Code 的性能。外包人员每项任务(约一小时)报酬 280 美元,负责编写提示词、审查代码并进行 A/B 测试,以训练模型生成更简化、易维护的代码。该项目旨在让 Claude Code 更贴近真实开发环境,目前仍在进行中,外包人员不知道所评估的模型版本。此举反映了 AI 公司依赖人类反馈来提升模型质量的行业趋势。AI产品Claude CodeAnthropic代码生成10 个信源在谈事件专题推荐理由:Anthropic 用真金白银砸出更懂开发的 Claude Code,做 AI 编程工具或依赖代码生成模型的团队值得关注——人类工程师的精细反馈正在定义下一代编程助手的质量天花板。原文稍后读已读值得跟进有用关注 Claude Code