机器人世界模型也有缩放定律了,8B 参数的 RoboJEPA 能用计算量预测真机表现,还能零样本规划长时程任务,代码全开源,搞具身的建议看看。
#缩放定律
共 21 条 · 7 天 1 条 · 30 天 4 条
信息流里打上「缩放定律」标签的资讯、产品与论文,按刊登时间排,新的在上。
10月8日
RoboJEPA:8B 参数机器人世界模型,首次给出计算量缩放定律
10月1日
9月29日
9月25日
论文09:48
层级贝叶斯分析显示:推理模型规模扩大能力递减,效率几乎不变这项研究拿 DeepSeek-R1-Distill 全系列做实验,结论挺扎心:模型变大只是解题能力强了一点,推理消耗的 token 一点没省,想靠堆规模提效率可能走不通。
8月21日
论文10:07
MoE 模型超参数高效迁移方法研究研究人员提出了一种方法,能通过小模型实验,准确预测万亿 token 规模 MoE 模型的最优学习率,省去了大量计算成本。他们用 155B 参数的模型验证了方法的有效性。
8月16日
8月12日
Dyna-2:仅用百万小时人类视频训练,零机器人数据也能提升机器人任务表现
Dyna Robotics 发了 Dyna-2,只靠看人类视频就能学会机器人操作,没碰过机器人数据也能越看越强,跟以前的做法很不一样。
8月11日
Meta新论文提出Skaling law:耦合容量与数据的新缩放定律
Meta新论文搞了个Skaling law,比Chinchilla和Kaplan那套准1.5到3倍,而且小规模跑就能算准,预算算力能省不少。
Dyna-2世界动作模型:100万小时人类视频训练发现新缩放定律
Dyna Robotics放出了个叫Dyna-2的世界动作模型,用100万小时人类视频训的,能预测未来再行动,还发现了数据量越大越强的缩放规律,值得看看。
7月28日
7月2日
6月13日
6月4日
6月3日
5月27日
MobileMoE:面向设备端部署的MoE语言模型,0.3B-0.9B活跃参数
MobileMoE解决了移动端大模型部署的算力与内存瓶颈,做端侧AI应用或手机端推理的开发者可以直接参考其架构和训练方案,实测性能提升显著。
5月25日
5月19日
5月16日
5月15日
论文08:58
Second Scaling Law 持续有效:增加思考 token 提升 LLM 性能做 LLM 推理优化或复杂任务应用的团队,这条定律意味着你不需要等更大模型——加思考 token 就能直接提升效果,值得在现有模型上试试。
5月14日
Meta 发布 Muse Spark:预训练效率超 Llama 4 一个数量级
Meta 用实际数据证明了 Muse Spark 的预训练效率比 Llama 4 提升 10 倍以上,做模型训练或资源优化的团队值得关注其缩放定律方法,可以直接借鉴来评估自己的模型效率。