12:27IT之家(博客/媒体)精选小鹏集团发布TuringViT视觉编码器,推出18L和24L两个版本,分别包含15层TLA和20层TLA。在1536×1536分辨率下,TuringViT-18L的推理吞吐量达到Seed1.5-ViT的3.04倍,相比SigLIP2-ViT-L提升2.16倍。该模型仅用0.85B图文对训练,在ImageNet-1K等六项零样本分类基准上取得83.6%平均准确率,超越使用10B数据的SigLIP2-L。TuringViT采用VISTA-Curation数据治理流水线,通过三步筛选优化图文数据质量,并支持四阶段渐进式原生动态分辨率训练。该编码器将应用于小鹏智能驾驶、智能座舱和IRON人形机器人。AI模型TuringViT小鹏视觉编码器推荐理由:小鹏自己搞了个TuringViT视觉编码器,只用了别人十分之一的数据就达到更好效果,还能跑车载和机器人,效率很高。原文稍后读已读值得跟进有用关注 TuringViT