11:30官方账号arXiv cs.AI@Victoria Graf, Hannaneh Hajishirzi, Noah A. Smith, David Kohlbrenner, Kyle Lo该论文提出通过公共讨论界面(如论坛评论)向大语言模型预训练数据注入恶意内容的攻击方法。作者引入HalfLife分析工具,用于评估网络爬虫数据中是否包含对抗性内容。实验表明,基于维基百科等传统数据源的投毒假设不适用于真实的大规模异构预训练语料库。研究强调第三方网页内容可能成为攻击语言模型预训练的潜在向量。论文HalfLife语言模型AI安全推荐理由:这篇论文讲了一种真实的预训练数据投毒方式——通过论坛评论注入恶意内容,还给出了分析工具HalfLife,搞AI安全的值得看。原文稍后读已读值得跟进有用关注 HalfLife
09:49官方账号arXiv cs.AI@Mohammad Allahbakhsh, Mohammad Hassan Bahari, Moslem Attar-Raouf传统渗透测试侧重评估对手能否通过漏洞获取资源,但AI系统中攻击者可通过提示注入、数据投毒、传感器操纵等路径改变行为而不入侵基础设施。论文重新定义AI系统渗透测试为操作目标驱动的行为评估,提出六步工作流:识别操作目标、映射AI行为、分析影响面、定义失败标准、执行场景测试、报告证据。以AI安全运营中心助手为例,演示提示注入可导致误判而不触发基础设施入侵。论文AI安全渗透测试提示注入推荐理由:这篇重新定义了AI渗透测试,从入侵系统变成操纵行为,提示注入、数据投毒都算,还给了具体测试步骤和案例,搞AI安全可以看看。原文稍后读已读值得跟进有用关注 AI安全
00:02IT之家(博客/媒体)OpenAI 发布安全研究员招聘,年薪高达 29.5 万至 44.5 万美元,面向 Preparedness 团队,研究 AI 自我改进时的安全问题。岗位要求候选人具备“良好品味和策略”,能推理未来可能但尚未出现的问题。OpenAI 计划在 2028 年前实现“真正的自动化 AI 研究员”,并正在推进自动化研究实习生项目。招聘信息强调防御数据投毒、解释模型推理和追踪技术自动化进展。Anthropic 也在探索 AI 监督更强大模型,其联合创始人预测到 2028 年底 AI 研发可能完全脱离人类参与。行业OpenAI安全研究AI 自动化10 个信源在谈事件专题推荐理由:AI 安全研究者或关注 AGI 风险的从业者值得关注——OpenAI 用高薪和明确方向告诉你,未来几年安全研究的关键战场在哪里。原文稍后读已读值得跟进有用关注 OpenAI