23:55elvis@omarsar0精选Robbyant 开源了 LingBot-VLA 2.0 的训练后代码。在单张 NVIDIA GeForce RTX 4090D 上,仅需 10 步去噪,推理耗时约 130 毫秒。这意味着用户无需集群即可进行适配和测试,大幅降低了部署门槛。AI模型LingBot-VLA 2.0RobbyantRTX 4090D10 个信源在谈事件专题推荐理由:Robbyant 把 LingBot-VLA 2.0 的训练后代码开源了,单张 RTX 4090D 跑出 130 毫秒推理,不用集群就能自己玩。原文稍后读已读值得跟进有用关注 LingBot-VLA 2.0
00:40elvis@omarsar0精选Robbyant(蚂蚁集团旗下具身AI公司)发布LingBot模型,据论文比较,它是首个实现小时级实时高保真生成且完全开源的研究模型。该模型没有长期记忆,离开的区域会被重新生成而非记住。代码、论文、权重已在GitHub、arXiv和Hugging Face上开源,演示由合作伙伴托管。AI模型LingBotRobbyantAnt Group1 个信源在谈事件专题推荐理由:Robbyant出了个LingBot,能小时级实时生成高保真3D场景,还完全开源,想动手跑模型直接下权重就行。原文稍后读已读值得跟进有用关注 LingBot
22:58elvis@omarsar0LingBot VA-V2是Robbyant(蚂蚁集团旗下)开发的视频动作基础模型,原生用于机器人控制。该模型接收视频输入即可生成机器人动作指令,无需额外传感器。项目页面和完整论文已在GitHub公开,提供技术细节与基准评测。AI模型RobbyantLingBot VA-V2Ant Group1 个信源在谈事件专题推荐理由:Robbyant这个视频动作模型直接用视频训练机器人,别家还没见过类似的。论文和代码全公开,搞机器人和具身智能的可以看看。原文稍后读已读值得跟进有用关注 Robbyant
12:43官方一手marktechpost@Asif Razzaq精选蚂蚁集团Robbyant团队发布LingBot-World-Infinity(LingBot-World 2.0),一个14B参数因果视频生成模型,用作交互式世界模拟器。核心创新包括混合双向自回归(MoBA)注意力机制和分布匹配蒸馏,解决长程漂移导致的纹理模糊和几何变形。报告展示单个60分钟不间断会话涵盖20个场景。但发布内容仅包含一个检查点、480P参考脚本,无部署代码和定量基准,且采用非商业许可CC BY-NC-SA 4.0。AI模型LingBot-World-InfinityRobbyant蚂蚁集团推荐理由:蚂蚁发了14B的世界模型LingBot-World-Infinity,能生成60分钟视频模拟20个场景,用MoBA注意力解决长时间漂移。不过目前只开放了检查点,没有完整代码。原文稍后读已读值得跟进有用关注 LingBot-World-Infinity
08:15官方一手marktechpost@Asif Razzaq76°蚂蚁集团Robbyant发布LingBot-VLA 2.0,一个6B参数的开源视觉-语言-动作模型(Apache-2.0许可证)。该模型在约6万小时数据上预训练,包括5万小时20种机器人配置的轨迹和1万小时人类视频。它使用55维规范动作空间统一不同形态,并采用无辅助损失的MoE动作专家扩展容量。在GM-100通用基准上,LingBot-VLA 2.0分别超过π0.5和上一代LingBot-VLA-1.0。AI模型LingBot-VLA 2.0Robbyant蚂蚁集团2 个信源在谈事件专题推荐理由:蚂蚁开源了6B的VLA模型LingBot-VLA 2.0,用6万小时数据训练,在GM-100上超过π0.5,做跨形态机器人操作很划算。原文稍后读已读值得跟进有用关注 LingBot-VLA 2.0
11:07官方一手marktechpost@Asif Razzaq精选蚂蚁集团旗下Robbyant团队开源了LingBot-Vision,一个1B参数的边界中心视觉基础模型。该模型使用掩码边界建模(Masked Boundary Modeling),将图像边界作为原生训练信号。在密集空间感知任务中,1B骨干网络匹配或超越更大规模的模型。LingBot-Vision还作为初始化权重用于LingBot-Depth 2.0深度估计模型。AI模型LingBot-VisionRobbyant视觉基础模型推荐理由:蚂蚁Robbyant开源了1B参数的视觉模型LingBot-Vision,聚焦边界感知,能直接初始化深度模型,性能不输更大模型。原文稍后读已读值得跟进有用关注 LingBot-Vision