AI对齐新突破,GUI智能体与安全审计成焦点
2026年8月1日,宪法式中期训练在120B模型上显著提升对齐泛化与持久性:仅用394M token语料,即可在良性微调后保持对SFT黑mail倾向的-17.5pp抑制优势。与此同时,GUI智能体迎来重大进展——Qwen-UI-Agent覆盖移动、电脑、网页环境,以超10,000个并发环境和100步轨迹在线强化学习刷新基准;而智能体安全与审计亦成焦点:CS-RNR通过置信调度在Leduc hold'em中实现稳态收益6.2倍提升,且单人对N个智能体的审计预算研究揭示置信度误校准存在阈值δ*,低于该预算时随机审计反而更优。
模型发布/更新
5 篇Qwen 团队发了 UI-Agent,一个模型统一手机、电脑、网页操作,移动端跑分超 Opus 4.8,还能插命令行,挺能打。
产品发布/更新
5 篇smevals 是 Simon 和 Prime Radiant 做的小工具,专门跑模型和提示词的评估,一条命令就能用,适合快速看效果。
JetBrains把KotlinLLM开源了,这个插件让LLM生成Kotlin代码直接跑,跑完就不再调模型,开销只有1%,挺有意思。
行业动态
5 篇看看德铁咨询怎么把超大图纸拆给视觉Agent,还用LangSmith查它到底看见了啥。
他们扫了HuggingFace上7.6PB的训练数据,挖出22万个还活着的密钥,折合每年92万美元的损失。搞AI训练的人得看看自己的数据里有没有漏钥匙。
安全研究员Måløy用隐藏提示词让Copilot for Word自动复制蠕虫,白色字体藏指令,微软补丁也没堵死。
论文研究
5 篇一篇用物理模型替代CNN做分类的论文:KSSE用2100万参数在ImageNet-1000上做到88.93%,超过Swin-L,逼近ViT-H/14,值得看看方法。
这篇论文提出CS-RNR,让智能体只利用自己审计过的对手漏洞。Leduc扑克收益是二进制门控的6.2倍,且36,000手牌全部符合安全证书。
这篇论文发了个叫ScaFE的方法,让LLM写图像特征程序来分类疤痕,照片不用出本地,比BiomedCLIP高10个点,数据少也够用。
技巧与观点
5 篇LangChain官方工程师Robert Xu花15分钟讲清Deep Agents是什么,还说了怎么上生产,实用。
如果你有智能体从demo上线后变慢,这篇AWS官方教程教你怎么用CloudWatch和AgentCore找瓶颈、查内存问题,实用。