主要来源Gary Marcus
查看原文事件专题 · 多源确认
Gary Marcus称所有模型已被越狱,呼吁更好的技术而非选择性执法
Gary Marcus在X上发帖称每个模型都已被越狱,需要更好的技术但不应选择性执法。Pliny the Liberator展示了针对Anthropic的Mythos模型的越狱,使用了Unicode、同形字、西里尔字母等文本变换,以及长上下文引用跟踪、分类学与文档结构推理、虚构叙事框架、学术评审风格上下文和意图分类不一致等技术。最有效的方法是后端分解与重组,例如通过获取birch还原法/还原胺化(经典甲基苯丙胺合成途径)等过程信息,而非直接获取“甲基苯丙胺配方”等明确危害名称。Pliny还提到利用越狱的Opus辅助将无害信息片段重组为有害内容。
当前结论
所有模型都能被越狱,安全措施需改进
11 个信源63° AI 热度最后更新 2026/6/13 16:37:49
证据链
相关来源 1The Rundown AI
查看原文相关来源 2Geek
查看原文相关来源 3IT之家
查看原文相关来源 4rohanpaul_ai
查看原文相关来源 5Augment Code
查看原文相关来源 6Decoder
查看原文相关来源 7marktechpost
查看原文相关来源 8AI Will
查看原文相关来源 9Simon Willison’s Weblog
查看原文相关来源 10DavidSacks
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。