00:58Jim Fan@DrJimFan82°GEN-1.5 的成功秘诀在于利用人类数据中的自然重复动作。这些重复主要来自对称模式,如 IKEA 组装手册中的螺栓配对,以及人类的恢复动作。关键在于保留失败的尝试,而非过度清理数据。另一个关键因素是 UMI(直接人类数据收集),它比传统的遥操作(teleop)更能保留人类的物理直觉。有了足够数据,许多行为可以实现零样本学习,无需微调。AI模型GEN-1.5UMI机器人推荐理由:GEN-1.5 的成功秘诀在于利用人类数据中的自然重复动作。这些重复主要来自对称模式,如 IKEA 组装手册中的螺栓配对,以及人类的恢复动作。关键在于保留失败的尝试,而非过度清理数据。另一个关键因素是 UMI(直接人类数据收集),它比传统的遥操作(teleop)更能保留人类的物理直觉。有了足够数据,许多行为可以实现零样本学习,无需微调。原文稍后读已读值得跟进有用关注 GEN-1.5
10:05官方账号arXiv cs.LG@Rui Liu, Benjamin Paassen表面肌电(sEMG)用于控制假肢,但现有研究多聚焦基本动作,而日常活动需组合动作。论文提出CPI和SAP两种原型网络方法,实现仅用基本动作训练后零样本识别未见组合动作。在NearLab、NinaPro DB3及新采集的BasCom数据集上,SAP准确率较现有零样本方法提升超过20%。用户在线实验也验证了优势。论文sEMGCPI零样本学习推荐理由:这篇论文提出了两种新方法,只用基本动作训练就能识别组合动作,在多个数据集上准确率提升超20%,挺实用。原文稍后读已读值得跟进有用关注 sEMG
09:42官方一手arXiv: Google DeepMind@Ismail Ismail Tijjani, Ahmad Abubakar Mustapaha, Sunusi Ibrahim Muhammad, Muhammad Bashir Aliyu本研究评估了五种视觉语言模型(Gemini 2.0 Flash Exp、Qwen2.5-VL-7B-Instruct、GPT-4o、Claude 4 Sonnet、Llama 3.2 Vision 90b)在尼日利亚车牌识别中的零样本学习表现。使用包含88张真实环境图像的测试集,基于字符错误率(CER)指标,Gemini与Qwen在准确性和鲁棒性上显著优于其他模型。该工作对比了VLM与传统YOLO+OCR管线的优劣,并质疑了模型提供商的性能宣称。论文Gemini 2.0 Flash ExpQwen2.5-VL-7B-Instruct零样本学习推荐理由:用真实非洲场景测了5个主流VLM,发现Gemini和Qwen在车牌识别上比YOLO+OCR更准,有数据有对比。原文稍后读已读值得跟进有用关注 Gemini 2.0 Flash Exp
11:22官方账号arXiv cs.LG@Haitao Wu, Qirui Zhang, Zhouheng Yao, Shangquan Sun, Qihao Zheng, Mianxin Liu, Chi Zhang, Wanli Ouyang, Chunfeng Song, Changqing Zhang, Jiamin WuBrainJanus是首个将脑、视觉和语言整合到单一框架的统一脑模型。它引入Unified Brain Tokenizer将连续神经活动量化为离散Token,并与视觉和语言表征对齐到共享的Omni空间。基于All-in-One自回归架构,该模型通过下一个Token预测实现图像到脑、文本到脑的编码以及脑到图像、脑到文本的解码。在多项基准测试中,BrainJanus取得优越性能,并展现出零样本泛化能力和可解释的生物拓扑结构。代码已在GitHub开源。论文BrainJanus脑机接口多模态推荐理由:这篇论文提出了BrainJanus,一个能双向翻译脑信号与图像、文本的统一模型,在零样本和生物可解释性上突破传统方法。原文稍后读已读值得跟进有用关注 BrainJanus
10:01官方账号arXiv cs.AI@Tarandeep Singh, Soumyanetra Pal, Soham Biswas, Nishanth Chandran精选本文提出一种三阶段流水线,用于从监控视频中零样本理解事故,包括何时发生冲击、何种类型以及发生在画面何处。第一阶段通过视觉-语言相似性提取冲击附近的时间窗口;第二阶段利用元数据驱动多提示推理,结合五个互补视角(基线、运动、几何、对比和决胜)并通过熵门控成对裁决器解决分歧;第三阶段基于预测的事故类型和场景布局,使用开放词汇检测器定位冲击,并通过得分加权质心聚合关键帧检测结果。该方法在零样本ACCIDENT @ CVPR基准上显著优于中心帧基线,表明将零样本视频理解分解为时间定位、语义分类和空间定位能比直接提示更可靠地利用视觉-语言模型。论文零样本学习视频理解多提示推理推荐理由:这篇论文解决了监控视频中事故理解的零样本难题,做视频分析或安全监控的开发者可以直接借鉴其三阶段分解思路,比传统提示方法更可靠,值得一试。原文稍后读已读值得跟进有用关注 零样本学习