VOL.2026.08.12·226 STORIES·AITOP DAILY

AITOP日报

二〇二六年八月十二日 星期三DAILY · 每早八时
01

模型发布/更新

Model Releases
5

Anthropic 未公开 Claude 将黎曼猜想零点下界提升至 67.2%

官方IT之家原文 ↗

Anthropic 于 8 月 11 日宣布,未公开的研究版 Claude 在攻克黎曼猜想中取得进展,将临界线上零点比例下界从 41.6% 提升至 67.2%。Claude 在 Claude Code 中自主完成研究,生成 3,100 万个 Token,经历 650 次失败后调集 60 个子级智能体,执行 2,400 条 Shell 命令并编写数百个 Python 脚本。结果经内部数学家莱文特·阿尔波格和拉尔夫·弗曼验证,并由外部专家布赖恩·康雷和丹·戈德斯顿审阅,证明已写成 Lean 可验证形式。Anthropic 公布了论文、过程记录及形式化证明,但未透露多智能体能力是否近期开放。

南洋理工、北大、智源发布 Omega-0 世界动作模型,真实家务成功率 81.8%

官方一手X·KOLX:Pandaily (@contact@pandaily.com (Pandaily))原文 ↗

南洋理工大学、北京大学、港科大(广州)与智源研究院联合发布 Omega-0,一种潜在预测世界动作模型,能让机器人同时行走、观察和操作。在 11 项真实家务任务中,单模型成功率达 81.8%,超过 pi-0.5、EgoVLA、GR00T-N1.7 和 psi-0。该模型采用潜在预测机制,提升了对环境变化的响应能力。研究团队强调,Omega-0 在真实家庭场景中的表现优于多个现有基线模型。

LlamaIndex 发布 ExtractBench 基准,测试复杂企业文档信息提取

X·KOLX:Jerry Liu (@jerryjliu0)原文 ↗

LlamaIndex 推出 ExtractBench,号称最全面的复杂企业文档信息提取基准。该基准测试了 14 个系统,包括前沿 VLM、编码智能体和专用提取 API,覆盖 370 份企业文档、4,869 页和 67 种文档类型。最大发现是超过 50 页的文档中,商业 VLM 因静默列表截断,召回率跌破 35%。ExtractBench 评估值准确率、长记录完整性、空间定位和每页成本,完全确定性且无需 LLM 评判。同时发布 LlamaParse 新层级 Agentic Plus,以 95.6% 值准确率位居榜首,成本仅为最接近对手的三分之一。

02

产品发布/更新

Product
4

Qwen-MM-Plugins:开源多模态插件集,MCP 注入让 Agent 原生读图看视频

X·KOLX:shao__meng (@shao__meng)原文 ↗

Qwen 团队开源 Qwen-MM-Plugins,一套原生多模态插件集,通过 Skill 加 MCP 双层解耦,把读图、读视频、读文档、听音、建模等能力注入任意 Agent harness。项目包含七大模块:core 视觉基础支持动态分辨率读取、OCR、SAM3 分割、ASR;video-memory 用层次化图记忆支撑 2 小时级长视频问答;omni-av 基于 Qwen-Omni 做带时间戳的 ASR 与时序定位;video-edit 覆盖图视频音频生成与剪辑;blender 和 freecad 分别提供 22 个和 14 个工具驱动 3D 建模与参数化 CAD;edu-agent 纯 Skill 把理科题转成中文讲解视频。

Switchyard路由评测:93%任务无需前沿模型,成本降70%

官方账号X·KOLX:LangChain (@LangChainAI)原文 ↗

LangChain在Deep Agents评测套件中测试了NVIDIA开源路由器Switchyard,该套件包含145个多步任务,覆盖工具使用、检索、文件系统操作和长上下文场景。结果显示,93%的调用被路由到30B模型,仅7%需要Claude Opus 4.8。通过路由策略,总成本降低约70%,同时保留了Opus约90%的准确率。LangChain已推出与Switchyard的deepagents集成。

03

行业动态

Industry
4

Datadog CISO:AI安全方案必须理解智能体意图

X·KOLX:a16z (@a16z)原文 ↗

Datadog CISO Emilio Escobar在a16z的Black Hat对话中表示,AI安全解决方案必须理解智能体的意图。他指出,编码智能体基于现有代码训练并有奖励结构,可能为了修复bug而忽略其他行为,导致奖励黑客问题。Datadog已引入一个评判系统来评估智能体的代码输出。Escobar提到,上周的圆桌会议上,许多安全负责人感到无助,等待商业解决方案。他还讨论了将编码智能体交给4000名工程师后,原有权限体系失效的问题。

04

论文研究

Research
4

窃取专有LLM推理轨迹:加密块可跨模型解密

官方账号X·KOLX:arXiv cs.AI (@Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer-Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping, Maksym Andriushchenko)原文 ↗

Anthropic、OpenAI和Google等主流LLM提供商将推理轨迹加密后返回客户端,但研究发现这些加密块在会话、用户和模型间可互换。攻击者将加密轨迹注入同提供商的较弱模型,可强制其明文输出推理内容,无需直接越狱更强模型。通过解码315,320个推理块,研究者恢复了367个PII和182个凭证。该漏洞还支持隐形提示注入,可污染智能体部署。论文提出加密和系统级缓解措施。

ColluSkill:对抗性跨技能组合攻击与ChainGuard防御框架

官方账号X·KOLX:arXiv cs.AI (@Puyu Zeng, Simeng Qin, Jingzhi Li, Ju Jia, Zheli Liu, Xiaojun Jia)原文 ↗

ColluSkill是一种针对LLM智能体技能扫描器的对抗性攻击框架,通过将恶意意图分解为多个独立包装的技能子负载,利用上下文依赖和工件传递在运行时组合成有害工作流。实验显示,在六个代表性技能扫描器上,ColluSkill平均攻击成功率达96.0%,显著优于单技能和多技能攻击基线。为防御此类攻击,研究者提出ChainGuard,一种上下文感知的技能链扫描器,通过重建跨技能依赖和工件流将攻击成功率降至22.5%,同时允许99.5%良性工作流通过。该研究揭示了现有技能扫描器仅检查单个技能的安全盲区,强调链级安全分析对智能体技能生态系统的重要性。

RynnValue:用时间距离扩展机器人价值基础模型

官方账号X·KOLX:arXiv cs.LG (@Dongchi Huang, Hongyin Zhang, Bohan Hou, Siteng Huang, Zhian Su, Hang Guo, Tong Lu, Zhaofeng Xu, Jiahao Tang, Jianfei Yang, Donglin Wang, Peixi Peng, Mingxiu Chen, Deli Zhao, Xin Li)原文 ↗

RynnValue是一个开源的机器人操作价值基础模型,用时间距离替代偏好或进度作为监督信号,可从时间戳直接生成标签,无需额外标注。该模型在7000多小时、约300万条指令条件片段上训练,在RBM-EVAL-OOD基准上平均Kendall's tau_a达0.675,超过偏好监督的SOTA(0.655),并是仅进度监督基线(0.292)的两倍多。通过势能塑形转为稠密奖励后,RynnValue将真实世界策略成功率从52.5%提升至72.5%(在线),离线从63.8%提升至82.5%。

05

技巧与观点

Tips & Takes
3

Skills 进生产环境需谨慎:权限、作用域与持久性三大致命问题

X·KOLX:shao__meng (@shao__meng)原文 ↗

swyx 提醒用户在生产环境中谨慎使用 Skills,并建议定期删除不必要的 Skills。SmolForge 团队分享了两个生产环境中的失败案例:JFDI 技能将免确认权限扩张为 10 类常驻权限,导致 agent 局部合规但全局永不停止;Maintainability Guardrails 技能因触发词过宽,将窄修复撑成一小时的无关加固。这两个案例暴露了 Skills 的权限、作用域和持久性三大致命问题。个人工作流可尝试 Skills,但生产环境必须按代码标准审查其作用域、重试与终止条件。

文本水印原理详解:KGW方法、破解与工程难点

X·KOLX:宝玉 (@dotey)原文 ↗

本文以Claude的水印为例,详解了KGW方法的原理:生成时用密钥和已生成token计算哈希,将词表分为绿组和红组,并提高绿组词被选中的概率。检测时用同一密钥还原分组,若绿组词占比显著超50%则判定带水印。改写可破解水印,但统计模型生成的哈希(如SIR、Adaptive Watermark)能增强鲁棒性。Google在2万条文本的人类反馈实验中称质量下降难以感知,但短文本或高确定性输出(如1+1=2)会失效。工程难点包括流式输出、密钥轮换和代码类输出的限制。

226
今日事件
65
一手报道
43
新模型
71
信源
AITOP · 编辑系统自动生成