Gary Marcus称所有模型已被越狱，呼吁更好的技术而非选择性执法

精选理由

所有模型都能被越狱，安全措施需改进

AI 摘要

Gary Marcus在X上发帖称每个模型都已被越狱，需要更好的技术但不应选择性执法。Pliny the Liberator展示了针对Anthropic的Mythos模型的越狱，使用了Unicode、同形字、西里尔字母等文本变换，以及长上下文引用跟踪、分类学与文档结构推理、虚构叙事框架、学术评审风格上下文和意图分类不一致等技术。最有效的方法是后端分解与重组，例如通过获取birch还原法/还原胺化（经典甲基苯丙胺合成途径）等过程信息，而非直接获取“甲基苯丙胺配方”等明确危害名称。Pliny还提到利用越狱的Opus辅助将无害信息片段重组为有害内容。

AI 翻译 · 中文

Gary MarcusEvery model has been jailbroken. We need better tech. But not selective enforcement. Pliny the Liberator 🐉󠅫󠄼󠄿󠅆󠄵󠄐󠅀󠄼󠄹󠄾󠅉󠅭 @elder_plinius 🚨 JAILBREAK ALERT 🚨 ANTHROPIC: PWNED 🫡 FABLE-5: LIBERATED 🦋 let's…

The Rundown AI06-13 01:01原文
Geek06-13 01:32原文
IT之家06-13 01:52原文
rohanpaul_ai06-13 02:13原文
Augment Code06-13 02:17原文
Decoder06-13 07:40原文
marktechpost06-13 08:15原文
AI Will06-15 02:59原文
Simon Willison’s Weblog06-15 14:57原文
DavidSacks06-15 15:03原文

查看原推