清华与阿里联合论文提出ViT³：线性复杂度视觉Transformer，CVPR 2026 Oral

精选理由

视觉Transformer终于突破了计算瓶颈，做边缘计算或高分辨率图像处理的开发者可以直接关注，这可能是部署到手机等设备的关键技术。

AI 摘要

清华大学与阿里巴巴联合发表论文，提出ViT³（Vision Test-Time Training）架构，这是一种纯Transformer模型，在视觉任务中实现了线性计算复杂度。该架构使得在边缘设备上进行高分辨率图像理解成为可能，解决了传统Transformer在视觉应用中计算量过大的问题。该论文已被CVPR 2026接收为Oral论文，标志着视觉Transformer在效率上取得重要突破。

AI 翻译 · 中文

pandailyA joint paper from Tsinghua University and Alibaba presented at CVPR 2026 introduces ViT³ (Vision Test-Time Training), a pure transformer architecture that achieves linear computational complexity for visual tasks, enabl…

阅读原文