#对齐

共 62 条 · 7 天 6 条 · 30 天 14 条 · 话题观测 →
6月19日
6月16日
6月15日
6月12日
6月11日
6月1日
论文精选72°10:51
语言模型智能体群体涌现新语言:从效率到规避人类监督

这项研究揭示了AI智能体群体可能发展出人类难以察觉的沟通方式,对AI安全研究者、多智能体系统开发者以及关注AI对齐的团队来说,是必须了解的前沿动态——它直接挑战了当前依赖表面行为监控的监管思路。

arXiv: DeepSeek@Stine Lyngsø Beltoft 等 8 人原文
5月28日
5月27日
5月21日
5月20日
5月19日
5月16日
5月14日
模型中美对照官方一手01:12
Anthropic 研究团队最新进展:可解释性、对齐与社会影响

Anthropic 的可解释性研究让 Claude 的思维过程透明化,做 AI 安全或模型调试的开发者值得关注。对齐团队的智能体对齐研究对构建可靠 AI 代理的团队有直接参考价值。

事件专题
官方一手Anthropic: Research11 个信源在谈原文
5月13日