宾夕法尼亚大学「World Models」课程讲义公开
宾夕法尼亚大学「World Models」课程讲义公开 ! 课程由 @thoma_gu 教授开设,回应的是 AI 领域一个正在成型的共识:仅靠人类写下的文本训练 LLM,学不到世界的全部知识。课程的...
朋友,宾夕法尼亚大学新开了一门「World Models」课,讲义公开了。这门课讲的是让AI模型学会预测世界变化,不是单纯靠文本训练。内容挺硬核,有基础理论、生成模型,还有视频、机器人这些应用,适合想深入了解世界模型的同学。
宾夕法尼亚大学开设的「World Models」课程讲义公开,由 @thoma_gu 教授主讲。课程核心是让模型学会预测世界下一步会发生什么,而非仅靠人类文本训练。课程包含基础与形式化、表征学习、生成模型基础等模块,并涵盖视频世界模型、空间世界模型、机器人学习等前沿应用分域。
宾夕法尼亚大学「World Models」课程讲义公开 ! 课程由 @thoma_gu 教授开设,回应的是 AI 领域一个正在成型的共识:仅靠人类写下的文本训练 LLM,学不到世界的全部知识。课程的...
宾夕法尼亚大学「World Models」课程讲义公开 ! 课程由 @thoma_gu 教授开设,回应的是 AI 领域一个正在成型的共识:仅靠人类写下的文本训练 LLM,学不到世界的全部知识。课程的核心信念是,让模型学会“预测世界下一步会发生什么”,这也是 LeCun 和 Fei-Fei Li 等 AI 前沿专家的观点,是通往更强智能的关键路径之一。 课程地址: cis.upenn.edu/~cis6280/ 课程的主线设计 首先明确一点:这不是一门 RL 课!课程只讲授理解世界模型所需的最少 RL/控制工具,重心放在三条贯穿始终的主线上: · 表征:如何把高维观测压缩成可用的状态; · 预测:如何在表征空间中预测环境演化; · 交互:如何用预测来规划和决策。 # 课程内容结构可拆成 6 个模块 1. 基础与形式化(第 1–4 讲):从世界模型的历史与概率形式化讲起,到环境/模拟器/rollout 的工程实践,再到卡尔曼滤波等状态空间模型。先把“世界模型 = 学到的环境动力学预测器”这个数学对象立起来。 2. 表征学习(第 5–6 讲):对比学习、JEPA 深度解析;LeCun 路线的核心组件,即在潜在空间中预测而非像素空间中重建。 3. 生成模型基础(第 7–11 讲):完整覆盖四大生成范式;隐变量/对抗模型、自回归模型、扩散与 Flow Matching、归一化流与自回归流(引用 TARFlow、STARFlow 等最新工作)。这五讲本质上是“现代生成建模的浓缩版”,因为生成能力就是预测能力。 4. 世界模型本体(第 14–15 讲):序列式生成世界模型 + 基于模型的 RL、规划与控制(MPC、CEM、“在想象中训练”)。Ha & Schmidhuber 经典的 World Models 和 DreamerV3 属于这一板块。 5. 前沿应用分域(第 16–25 讲):这是课程最有分量的部分,按领域展开。 · 视频世界模型(两讲:生成架构与 rollout;交互、记忆与效率);对应 Sora/Genie 这条线; · 空间世界模型(两讲:几何与 3D 表征;4D 动态与交互);对应 World Labs 方向; · 神经物理:学习物理动力学; · 机器人学习(两讲:仿真、控制、sim-to-real;VLA 与 world-action 模型)——对应当下机器人基础模型热潮; LLM 作为世界模型 与推理模型(deliberation、recurrence、test-time compute);把“语言模型是否已隐式学到世界模型”这一争论纳入课程; · 数字智能体(digital agents);浏览器/操作系统层面的具身。 6. 评估(第 26 讲):如何评测世界模型;一个学界尚无共识的开放问题。 实践设计:三次作业的编排刻意对应 “从零搭一个世界模型栈”:建环境 → 训世界模型 → 学策略。期末研究项目要求学生在四个领域(物理系统、视频/空间、机器人、语言/数字智能体)中选一个,且必须显式定义状态、转移、动作接口和评估标准;这个约束本身就是对“什么是世界模型”的操作性训练。项目带 leaderboard 和 12 月初的汇报,研究导向明确。 Jiatao Gu @thoma_gu We’re teaching a new course at Penn: CIS 6280 · World Models 🌍 cis.upenn.edu/~cis6280/ g Every day, LLMs amaze me with one more thing they can solve. But I’ve always felt there’s more to learn than what humans have written down—from observing the world, interacting with it, and experiencing what happens next. To me, that’s what world models are about—and why I see them as one of AI’s next big bets. However, I struggled to find a systematic course on them—so we are building one! Topics will include: representation learning, generative models, simulation, model-based RL, video and 3D generation, world models for robotics, reasoning, and code-based world models. Hands-on work will include: - Building an environment - Training a world model - Learning a policy and a final research project with leaderboard. We’re already six lectures in. Slides, demos, and readings are public, and we’ll keep adding materials throughout the fall. Big thanks to our TA team— @TongMutianTMT @hagsaeng_bag @EnxinSong @KeelyAi04 —for helping bring this course to life! 🔗 View Quoted Tweet 💬 0 🔄 0 ❤️ 0 👀 99 ⚡