7月2日
15:25
15:25AI Will@FinanceYF5
Aaron Lemke使用Fable 5为其强化学习生物添加了毛发和新的语音。语音基于神经网络的激活状态(左上图显示)。该演示使用了Three.js和WebGL/WebGPU进行渲染。模型在Runpod上使用JAX和MuJoCo(来自Google DeepMind)训练。
事件专题

推荐理由:看Aaron Lemke用Fable 5给他的RL生物加上毛发和实时语音,声音还跟着神经网络激活变化,太酷了。
15:20
5月13日
00:33
00:33官方一手Google Developers Blog博客/媒体
Google的MaxText框架现在支持在单主机TPU上进行监督微调(SFT)和强化学习(RL),利用JAX和Tunix库实现高效模型优化。开发者可通过GRPO和GSPO等算法轻松调整预训练模型以适应专业任务和复杂推理。该更新简化了从单主机到多主机配置的微调流程,为后训练工作流提供了可扩展路径。
推荐理由:这表明Google正在降低TPU上高级模型微调的门槛,让中小规模团队也能在单主机TPU上应用RL算法进行后训练,对AI开发实践有实用价值。