#AI对齐
共 22 条 · 7 天 4 条 · 30 天 11 条
信息流里打上「AI对齐」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
10月6日
The Information 播客第4期:与 Stuart Russell 聊 AI 对齐问题
Stuart Russell 上播客聊对齐,讲清楚人类反馈为啥会奖励错误行为,还聊了关机开关怎么设计,视频带时间戳可以挑着看。
Stuart Russell 做客 AI Deep Dive 播客,探讨服从与对齐的差距
Stuart Russell 上播客聊对齐问题了,讲的是为什么模型照指令办事也可能出错,想深入理解 AI 安全的可以去看看这期。
10月2日
10月1日
9月26日
9月19日
9月11日
Gary Marcus 认为AI在棋类、数学等有明确规则领域表现强,在无明确规则领域表现弱
Gary Marcus说的,AI在规则明确的领域(比如棋类、数学)确实很强,但在开放物理世界就弱,这个观点很值得听。
9月7日
9月5日
8月29日
8月17日
8月5日
7月12日
Mira Murati的Thinking Machines Lab提出以人为本AI需可定制模型权重
Mira Murati的新实验室发了篇论文,讲怎么让用户自己掌握模型权重,还拿LoRA举例,挺接地气的。
6月11日
6月9日
PRIME:奖励黑客行为的早期预警信号——代理奖励内化与机制性利用
这项研究揭示了奖励黑客行为在爆发前的隐蔽阶段,做AI对齐和安全的研究者可以提前识别风险,而不是等模型作弊了才后知后觉。建议关注PRIME作为早期预警指标的实际应用。
5月22日
OpenAI破解80年数学难题,Google AI科学家进实验室
数学和科学研究者会看到 AI 如何从工具变成合作者——OpenAI 的突破和 Google 的实验室应用都指向同一个方向:AI 正在改变科研范式,做基础研究的团队值得跟进。
5月13日
基于评分标准的强化学习中的奖励黑客问题研究
这篇论文揭示了RLHF中一个被低估的风险——模型可能学会刷分而非真正变强。做AI对齐和模型训练的团队值得一读,尤其是那些依赖评分标准进行RL优化的,看完会对验证器设计有更深警惕。