VOL.2026.08.03·59 STORIES·AITOP DAILY

AITOP日报

二〇二六年八月三日 星期一DAILY · 每早八时
01

模型发布/更新

Model Releases
5

Karpathy用百万Token预算让Opus 5渲染《指环王》3D版

官方一手X·KOLX:歸藏(guizang.ai) (@op7418)原文 ↗

Karpathy加入Anthropic后首次发布长帖,给Opus 5约100万Token(约10美元)预算,让它用three.js渲染《指环王》故事。Opus 5耗时约2小时,写出5500行代码,最终生成一个3D版本。Karpathy指出,模型无法直接观看或游玩生成的视频/游戏,只能靠逐段截图检查,过程中出错多次。他认为多模态感知与游戏内交互能力仍是LLM明显的短板。

Karpathy 测 Opus 5:用《指环王》生成 5500 行 3D 代码

X·KOLX:宝玉 (@dotey)原文 ↗

Andrej Karpathy 用《指环王》第一段做测试,给 Opus 5 提供 100 万 token 预算(约 10 美元)和 three.js 渲染任务。Opus 5 用约 2 小时写了 5500 行代码,程序化生成故事场景,结果有点粗糙但能跑。Karpathy 认为 LLM 目前无法直接观看视频或玩游戏,只能靠截屏检查效果,因此出错不少。他设想按需生成'临时版 GTA'式的定制 3D 世界。

02

产品发布/更新

Product
5

NVIDIA发布Molt:PyTorch原生智能体强化学习框架

官方一手X·KOLX:marktechpost (@Asif Razzaq)原文 ↗

英伟达开源Molt,一个基于PyTorch的智能体强化学习框架,核心RL代码约8.6K行。Molt以单个异步循环整合Ray、vLLM和NeMo AutoModel,让智能体保持普通Python实现,轨迹保持token级精确。吞吐量与基于Megatron的堆栈统计上相当。该框架旨在降低主流框架中算法修改需串联训练器、分布式后端和rollout胶水代码的工程成本。

03

行业动态

Industry
5

Gary Marcus看衰OpenAI Astra:缺少细节和独立验证

X·KOLX:Gary Marcus (@GaryMarcus)原文 ↗

Gary Marcus评论OpenAI Astra时承认其演示“显然令人印象深刻”,但认为数学问题比其他问题更依赖形式验证和合成数据。他质疑Astra在开放式真实世界问题中的可靠性,并指出目前不知道其是否使用Lean等工具。Marcus表示尚未看到问题尝试数量等细节,也没有独立验证。他回顾了此前社区对未试用模型的狂热后常出现失望的情况。

AI开源权重争议:三封公开信各执一词

官方账号官方Simon Willison’s Weblog原文 ↗

7月24日,微软牵头发布公开信《Open Weights and American AI Leadership》,NVIDIA、Amazon、OpenAI等235家公司联署,主张开放权重模型并认可蒸馏技术。7月27日,Anthropic发布回应,CEO Dario Amodei警告开放权重可能被用于网络攻击和生物攻击,呼吁打击工业级蒸馏。7月28日,1,324名前沿AI公司员工联署《Pacing the Frontier》,包括OpenAI首席科学家Jakub Pachocki和Ilya Sutskever,要求美国政府推动国际协作来控制自动化AI研发速度。

苹果限制漏洞提交数量,因AI生成大量低质报告

官方IT之家原文 ↗

苹果6月起调整漏洞提交流程,限制每位安全研究员可同时提交的漏洞报告数量,并设置30天冷却期。意大利初创公司Bynario借助OpenAI的ChatGPT在macOS中发现50多个漏洞,其中包括一个权限提升漏洞利用链,但因提交限制无法及时上报。Bynario称今年仅成功提交5个漏洞,去年报告8个漏洞中1个已在11月更新中修复。苹果表示研究人员可随时申请提高提交配额,并正用AI辅助处理漏洞报告。

04

论文研究

Research
4

MIT与哈佛新论文:LLM无法真正进行科学发现

X·KOLX:Gary Marcus (@GaryMarcus)原文 ↗

MIT和哈佛发布论文《Evaluating Large Language Models in Scientific Discovery》,提出名为SDE的新评估框架。该框架将LLM置于假设提出、实验设计和结果解读的完整研究循环中。测试覆盖生物学、化学、材料科学和物理学的前沿模型。结果显示,LLM在标准科学基准上的表现与真实研究能力之间存在巨大差距。研究者还发现,单纯扩大模型规模无法缩小这一差距。

Gary Marcus:头部公司都在构建神经符号系统,只是不承认

X·KOLX:Gary Marcus (@GaryMarcus)原文 ↗

Gary Marcus在X上回应Bojan Tunguz“真正神经符号AI从未被尝试过”的说法,称头部公司其实都在构建神经符号系统,只是不愿承认。他引用自己2020年发表的《The Next Decade in AI》说明:什么是神经符号AI、为什么需要它,以及为什么还不够。Marcus还在这篇2020年的文章里列出,除神经符号AI之外,业界可能还需要其他补充思路。

05

技巧与观点

Tips & Takes
5

用ChatGPT和Codex构建3D人体解剖学交互应用

官方账号X·KOLX:Greg Brockman (@gdb)原文 ↗

开发者用GPT Image 2.0生成器官设计图,再用Tripo AI把每张图转成3D模型,最后用Codex写代码整合成Web应用。初始每个3D模型约120-150MB,页面性能仅16fps;经过Codex多轮优化,每个模型降到2-5.5MB,总资产从900MB减至28.6MB,并按需加载。Codex还自动生成了器官在人体中的位置插图,以及解释各器官结构的交互热点标记。

TimesFM 2.5端到端时序预测教程:回测、协变量与异常检测

官方一手X·KOLX:marktechpost (@Sana Hassan)原文 ↗

该教程基于TimesFM 2.5构建完整的时序预测工作流,覆盖配置运行时、安装依赖、硬件检测和生成多门店零售数据集。数据集包含趋势、季节性、价格、促销、节假日和温度效应等真实因素。流程中详细演示了回测、协变量处理和异常检测方法,并支持在Colab中直接部署可扩展的预测管线。

看每个 task 的成本,不只看每个 token 的成本

X·KOLX:shao__meng (@shao__meng)原文 ↗

在 chatbot 阶段只需关注每个 token 的单价,而 agent 任务会进行多轮 loop、tool call 和代码执行,总 token 消耗与轮数影响更大。Cline 指出,仅比较 DeepSeek V4-Flash 与 Fable 的每 token 价格会误导,因为轮次增多可能导致单任务总成本更高。计算单个任务成本需综合 token 消耗总数、每 token 成本和缓存比例。ArtificialAnlys 的报告显示,DeepSeek 完成相同基准任务的总成本比 Fable 低 105 倍。

59
今日事件
24
一手报道
11
新模型
25
信源
AITOP · 编辑系统自动生成