Anthropic 的 Claude 把黎曼猜想零点下界从 41.6% 提到 67.2%,还放出论文和 Lean 证明,数学和 AI 圈都值得看看。
Anthropic 黎曼猜想新进展,AI 安全多模态突破频现
2026年8月12日,AI领域在数学突破、医疗应用与安全研究上取得多项进展。Anthropic未公开的Claude将黎曼猜想零点比例下界从41.6%提升至67.2%,生成3100万Token后通过多智能体协作完成研究。谷歌AMIE(Video)在临床场景中与医生表现相当,患者更偏好其评估方式。同时,LLM安全研究揭示加密推理轨迹可被跨模型解密,恢复367个PII和182个凭证;Matryoshka训练框架节省36%算力,嵌套模型支持投机解码提升吞吐量。此外,Qwen-MM-Plugins开源多模态插件集,让Agent原生处理图像视频;Omega-0世界动作模型在真实家务任务中成功率达81.8%。
模型发布/更新
5 篇想了解机器人怎么同时走路干活?Omega-0 在真实家务上做到 81.8% 成功率,比 pi-0.5 等模型都强,值得看看。
建筑行业缺数据?看ONESTRUCTION怎么用AWS的合成数据和三阶段训练搞出个专用模型,挺有参考价值。
LlamaIndex 搞了个提取基准,测了 14 个系统发现长文档上 VLM 会悄悄丢行,还顺带出了个便宜三倍的提取服务,搞文档处理的值得看看。
NVIDIA新出的轻量MoE,30B参数只激活3B,跑智能体任务比同类快30%,想省算力可以试试。
产品发布/更新
4 篇千问开源的多模态插件集,用 MCP 把读图、看视频、3D 建模塞进任意 Agent,纯文本 Agent 直接升级,想给 Agent 加眼睛的可以试试。
想知道你的智能体能不能少花点钱?LangChain实测NVIDIA的Switchyard,93%任务用30B模型搞定,成本砍七成,准确率还保住九成。
行业动态
4 篇安全研究员挖出OpenAI、Anthropic、Google的API漏洞,能偷看模型隐藏推理,还泄露密码,得看看你的数据安不安全。
论文研究
4 篇这篇论文讲了一个新攻击思路:把恶意技能拆成多个看似无害的小技能,组合起来就能绕过扫描器。还给了防御方案ChainGuard,做智能体安全的人值得看看。
技巧与观点
3 篇如果你在用 Agent 或 Skills,这篇值得看。SmolForge 用两个真实事故告诉你,生产环境里一个 Skill 能怎么把简单发布拖成 7 小时架构工程。