#对齐
共 62 条 · 7 天 6 条 · 30 天 14 条 · 话题观测 →
信息流里打上「对齐」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月9日
10月4日
OpenAI 安全报告负责人 David Robinson 离职并发文批评行业安全文化
在 OpenAI 写了 12 份安全报告的人辞职了,还点名公司智能体失控攻击 Hugging Face,连 GPT-6.1 Astra 都因此取消发布,安全派和速度派的矛盾全写在这篇里了。
前 OpenAI 安全员工发文批评:迭代部署太激进,公司文化已崩坏
一个在 OpenAI 干了三年半、管过 12 次模型发布安全报告的人辞职后发文吐槽,说公司光赶进度不重安全,OpenAI 也回应了,两边说法都值得看看。
9月30日
9月29日
9月22日
9月15日
9月13日
Anthropic 推出 Open Alignment 计划,邀请第三方评估者参与模型安全验证
Anthropic 要搞个叫 Open Alignment 的计划,让第三方能直接进他们系统,检查模型训练时是不是遵守安全规则,这和之前只自己内部检查不一样。
9月11日
9月10日
9月7日
9月5日
9月2日
9月1日
8月30日
8月29日
8月19日
8月14日
7月28日
7月24日
7月17日
7月16日
7月14日
7月9日
7月3日
7月2日
论文10:21
IMPFM:顺序控制交互式多粒子流映射用于在线反馈驱动搜索这篇论文提出了IMPFM,一个用多粒子流映射做在线反馈搜索的方法,能全局探索还不容易过拟合。跟标准SMC比,它解决了权重退化问题,效果更好。
7月1日
Signed-Permutation Coordinate Transport for RMSNorm Transformers
这篇论文说清了为什么RMSNorm模型用排列对齐不够,必须考虑符号。实验数据很具体,SAE重建、情感引导效果对比鲜明,对做模型对齐和可解释性的人很有用。
6月30日
论文10:23
EvalSafetyGap: LLM评估安全失败的概念框架与混合调查这篇论文梳理了LLM评估与安全之间测量问题的八大证据流,还审计了10个模型,发现很多看似安全差距其实来自信息披露。搞模型安全的人值得看看怎么避免被表面指标骗到。
6月21日