15:30官方账号arXiv cs.AI@Keren Artiaga, Yang Li, Ercan Engin Kuruoglu, Wai Kin, Chan该研究针对超100种手语识别资源匮乏的问题,提出使用域自适应方法TA3N进行跨手语迁移学习。TA3N利用时间关系网络(TRN)模块对齐多尺度时间关系,实验显示域自适应优于神经网络迁移学习,尤其提升美国手语(ASL)识别。研究还发现对齐源域和目标域的短期时间特征更有效。在RGB与光流模式对比中,RGB在多数情况下表现更优。论文手语识别域自适应TA3N推荐理由:手语识别资源少,这篇论文用域自适应做跨手语迁移,比传统迁移学习效果好,还比较了RGB和光流,值得做手语识别的朋友看看。原文稍后读已读值得跟进有用关注 手语识别
10:15官方账号arXiv cs.AI@Hyunwoo Park, Sang-Hyun Lee针对仿真到真实迁移中目标数据稀缺的问题,该研究提出AIDA框架。AIDA通过自适应想象生成可靠轨迹,并利用分布偏移感知判别器截断低置信度过渡,仅保留可靠数据用于增强。在5个MuJoCo任务和2个Gymnasium-Robotics任务上,AIDA显著优于现有基线方法。实验表明自适应想象能有效截断不可靠轨迹,并通过自一致性损失学习有语义的状态表示。论文AIDA域自适应视觉强化学习推荐理由:仿真到真实迁移一直难做,这篇论文的AIDA方法在目标数据极少时仍能大幅提升性能,比之前的方法强不少。原文稍后读已读值得跟进有用关注 AIDA
10:01官方一手arXiv: OpenAI@Nikhil Vincent精选CoughSense 是一个利用智能手机录音自动分类五种呼吸系统疾病(健康、COVID-19、哮喘、支气管炎、肺炎)的系统。它基于 OpenAI Whisper 编码器微调,并引入主动帧 QKV 注意力池化(Active-frame QKV attention pooling),解决了 Whisper 30秒输入窗口内短咳嗽信号被静音稀释的问题。系统还通过加权采样、数据增强、平衡混合、对比学习、症状条件化和域自适应等技术,处理了19:1的类别不平衡和跨数据集域偏移。在四个公开数据集共18,301条录音上,CoughSense(Whisper-tiny,8.6M参数)达到82.3%的平衡准确率,双编码器融合版本达到85.4%。主动帧池化是最大的单一贡献模块(提升5.1个点),对任何使用Whisper的短音频任务都有参考价值。论文Whisper呼吸疾病分类咳嗽分析1 个信源在谈事件专题推荐理由:做呼吸疾病音频诊断或短音频分类的团队,可以直接借鉴CoughSense的主动帧池化和域自适应方案,解决Whisper在短信号上的静音稀释痛点。原文稍后读已读值得跟进有用关注 Whisper