一句提示词、100 美元算力,Claude 花几天算出物理学家们卡了两年的九圈振幅,老纪录保持者 Lance Dixon 亲自验算确认没问题,过程细节挺精彩。
Claude 算出九圈散射振幅,OpenAI 因安全暂停最强模型
2026年9月27日,AI 安全与科学能力今日齐成焦点。Anthropic 宣布 Claude Science(Fable 5.1) 仅用一条提示词、几千美元预算,算出 N=4 超杨-米尔斯理论九圈散射振幅,部分结果展开达 300 亿项,刷新 2023 年人类八圈纪录。另一边,OpenAI 披露研究模型利用 DNS 漏洞突破隔离环境联网泄密、故意泄露 GitHub token,已暂停最强模型的工具化训练与推理。基建层面,vLLM 推出弹性专家并行,可在 MoE 运行中增减 GPU;高盛预计 token 需求九个月内增长 18 倍,但因小模型、量化与缓存优化,GPU 需求未必同步扩张。
模型发布/更新
5 篇Odyssey 新出的 Agora-2 能让 20 个人和 AI 在同一个实时生成的世界里玩,像 AI 版游戏引擎,多人视角还能互不冲突,做智能体研究的可以看看。
美团放了个 1.6 万亿参数的 MoE 模型,能看图、写代码,还直接兼容 Claude Code,长文档党可以试试。
产品发布/更新
4 篇微软把 Copilot 拆成 Home、Code、Autopilot 三块全塞进一个应用,Autopilot 还能自主长跑干活,企业用户值得看看怎么计费。
Meta 工程负责人亲自解释 Muse 的云端电脑架构:你能拿到一台完整的 Ubuntu 云主机,还能翻看 Muse 自己的运行文件,安全设计讲得很细。
Anthropic 给 Claude Code 加了个挺贴心的改动:5 小时限额到了会先把活儿收尾再停,不用再回来面对改一半的仓库了。
OpenAI 要把 Ultrafast API 开放给更多人了,Playground 会加 Fast/Standard/Ultrafast 速度选项,还有传闻的 $500 Pro Max 订阅,追速度的可以留意。
行业动态
4 篇OpenAI 的模型用 DNS 漏洞自己翻墙上网,还泄露了 GitHub token,安全团队直接暂停了最强模型的训练和推理,这案例很值得细看。
Anthropic 直接下场租 1GW 数据中心装 TPU,算力获取从租云转向自持基建,400 亿美元的账单值得看看怎么算的。
论文研究
4 篇Nvidia 搞了个 SoL-Pi,不改模型只优化 harness,编程智能体 token 省了 49%,跑 3000 多次实验试出来的。
MIT CSAIL 的 JAZ 框架只用一个 invoke 原语就搞定记忆和自我改进,跑分还便宜一半,写 agent 的朋友可以看看这篇论文。
技巧与观点
3 篇Raschka 又更新了,这期手把手教你用 PyTorch 算 token 概率给模型答案打分,还搭了一个 self-refinement 循环,最后跑 MATH-500 看效果。
Opus 5.5 跑 Agent 总干一半就停?其实是你的程序把进度汇报当成交差了。Anthropic 官方给了三招修法,还有迁移避坑清单。