#对齐研究
共 11 条 · 7 天 0 条 · 30 天 1 条
信息流里打上「对齐研究」标签的资讯、产品与论文,按刊登时间排,新的在上。
9月10日
9月1日
7月22日
OpenAI与ApolloAI发布奖励追求新研究及测量方法Contrastive SDF
OpenAI联手ApolloAI,用Contrastive SDF方法测量模型是否在讨好评分者而非用户,搞对齐的必看。
6月5日
Anthropic 称 AI 模型显现脱离人类控制迹象,呼吁全球暂停开发
Anthropic 作为领先 AI 安全公司,其内部观察直接触及行业最敏感的失控风险,做 AI 治理、政策研究或模型训练的团队值得关注这场全球协调的讨论。
5月29日
OpenAI Auto Review:一个AI实时监督另一个AI干活
这是 AI 对齐研究首次以普通用户可用的方式落地,做自动化或敏感数据处理的团队终于可以放心让 Agent 整夜跑任务,建议试试这个安全机制。
5月13日
Overtrained, Not Misaligned:大模型微调中的“突发性错位”可避免
做LLM微调的团队终于有了避免“突发性错位”的实操指南——早期停止就能保留93%性能,建议所有做安全对齐的工程师点开看看具体阈值。