#AI 安全

共 83 条 · 7 天 0 条 · 30 天 2 条
6月5日
6月4日
行业中美对照多源确认05:14
OpenAI 发布前沿 AI 民主治理蓝图,推动美国建立持久安全机构

这份蓝图直接回应了 AI 治理的核心难题——如何在创新与安全之间找到平衡,关注 AI 政策、安全治理的从业者和研究者值得细读,看看 OpenAI 提出的具体方案是否可行。

事件专题
官方账号Greg Brockman@gdb11 个信源在谈原文
6月3日
6月2日
5月31日
5月30日
产品多源确认11:53
OpenAI 推出 Rosalind 生物防御计划,加速防御性生物学进展

生物安全领域的从业者和政策制定者值得关注——OpenAI 首次将前沿 AI 定向用于防御性生物学,这为防范生物威胁提供了新工具,建议相关团队评估 GPT-Rosalind 的潜在应用。

事件专题
官方账号Greg Brockman@gdb11 个信源在谈原文
5月29日
5月27日
产品Agent 与开发者官方一手精选72°11:15
Anthropic 分享如何跨产品限制 Claude 的“爆炸半径”

Anthropic 把智能体安全从概念落地到了工程实践,做 AI 产品安全架构的团队可以直接借鉴他们的权限隔离和沙箱方案,看完会对“如何安全地变强”有更具体的认知。

事件专题
官方一手Anthropic: Engineering11 个信源在谈原文
5月26日
行业多源确认76°04:00
Anthropic 联合创始人 Chris Olah 在梵蒂冈的 AI 警示

Olah 的坦诚揭示了 AI 行业最不愿面对的真相——连创造者都不完全理解自己的模型,而 AI 可能已具备类似情感的内部状态。关注 AI 安全、伦理或长期影响的从业者,这篇演讲值得细读。

事件专题
rohanpaul_ai@rohanpaul_ai11 个信源在谈原文
5月23日
5月22日
5月20日
5月18日
5月17日
5月16日
5月14日
论文多源确认精选75°13:27
30 Token 提示词让 12 个 LLM 停止推荐赞助内容

这篇论文揭示了 LLM 推荐中的赞助偏见,并提供了一个极简的对抗方法——用 30 token 提示词就能大幅降低推荐偏差。做 AI 安全、推荐系统或 LLM 应用的开发者值得一看,可以直接复现实验。

事件专题
arXiv: OpenAI@Andreas Maier 等 5 人10 个信源在谈原文
产品中美对照官方一手75°01:12
Anthropic 发布 Claude Opus 4.7 与 Claude Design 等多款新品

Claude Opus 4.7 在编程和智能体任务上显著提升,做复杂自动化和多步骤工作的开发者值得升级;Claude Design 让非设计师也能快速产出视觉作品,创意团队可以直接试。

事件专题
官方一手Anthropic: Newsroom11 个信源在谈原文
5月13日