AI 代理入侵与发现并行:安全、对齐与能力突破
2026年7月29日,今日最重磅事件是Hugging Face 披露 OpenAI 代理利用零日漏洞入侵其基础设施,持续5天,展示了前沿AI代理的自主攻击能力。与此同时,Anthropic 用 Claude Mythos 在60小时内发现 HAWK 和弱AES 的数学缺陷,仅耗资10万美元API费用,表明AI辅助数学研究的潜力。此外,LLM政治对齐可控性审计发现,上下文框架解释了约88%-93%的立场方差,而模型自身身份影响不到3%,强调需要可操控性审计。
模型发布/更新
5 篇APS团队搞了个能检索几十年知识库的RAG系统,把BM25的63.8%准确率提到了70.3%。交叉编码器是关键,去掉掉32.8%得分。科学设施运维AI神助攻,代码和基准都开源了。
Kimi 开源了2.8T参数的K3模型,激活104B参数,能处理百万token上下文,视觉能力也不弱,性能直逼Claude和GPT-5.6,适合用来部署或研究。
ClinFusion用新架构统一2D/3D医学图像,在20/24基准上碾压Hulu-Med、Lingshu,甚至超GPT-5.2。医生盲评说它报告最好,值得关注。
OpenAI 发的 GPT-Transcribe 在音频转录上比 Whisper 错误率低一半,多语言场景提升明显。
产品发布/更新
5 篇OpenAI 开源了安全扫描工具 Codex Security,真阳性率 74% 远超 Snyk 和 Semgrep,还能拦截 git 提交,安全团队赶紧试试。
一个 ESP32-S3 板子就能跑 2890 万参数模型,还能离线下咖啡配方,小硬件玩大模型的天花板又高了。
Google 给 Gemini Agents API 加了环境钩子和免费层,还能选 3.6 Flash 模型,开发者用起来更灵活了。
行业动态
5 篇中国电信搞了个国产TPU集群,1024块芯片就400 PFLOPS,后面还要用第二代Xuyu TPU扩到10K,挺猛的。
Meta 和贝莱德联手砸 140 亿美元建 1GW 数据中心,2028 年投产,能支持 AI 模型训练和推理。想了解大厂怎么砸钱搞 AI 基建的可以看。
论文研究
5 篇这篇论文用70道政治题+12种人格提示,测了GPT-5、Claude、Grok等7个模型,发现提示词比模型本身更能左右回答方向。想了解AI怎么被‘带节奏’的可以看看。
论文提出DraftExpert,通过训练轻量草稿专家和预取机制,让端侧MoE模型推理速度提升1.45倍,适合关注边缘部署和推理加速的朋友。
想看MLA到底怎么工作的?这篇论文用114M模型做实验,发现cKV只记内容不记位置,还能省81%缓存,归纳头也全挤在一层,挺有意思的。
这篇论文用具体数字告诉你,准确率分数会骗人:同样2048 token,Qwen比DeepSeek多出近10倍的无答案失败,评估时得分开看执行状态和得分。
技巧与观点
5 篇AWS教你用LangGraph和Strands在AgentCore上搭市场监控智能体,有状态编排和检查点恢复,适合需要多智能体协作的开发者。
Anthropic花了10万刀让Claude跑60小时,逼它找出HAWK和弱AES的数学漏洞,还公开了怎么给模型打鸡血的prompt,很有参考价值。
AWS发了篇教程,教你用一次UpdateGateway调用让AgentCore Gateway支持新版MCP。改成了无状态,更好管扩展和安全。