15:30官方账号arXiv cs.AI@Keren Artiaga, Yang Li, Ercan Engin Kuruoglu, Wai Kin, Chan该研究针对超100种手语识别资源匮乏的问题,提出使用域自适应方法TA3N进行跨手语迁移学习。TA3N利用时间关系网络(TRN)模块对齐多尺度时间关系,实验显示域自适应优于神经网络迁移学习,尤其提升美国手语(ASL)识别。研究还发现对齐源域和目标域的短期时间特征更有效。在RGB与光流模式对比中,RGB在多数情况下表现更优。论文手语识别域自适应TA3N推荐理由:手语识别资源少,这篇论文用域自适应做跨手语迁移,比传统迁移学习效果好,还比较了RGB和光流,值得做手语识别的朋友看看。原文稍后读已读值得跟进有用关注 手语识别
00:25The Rundown AI@therundownaiGoogle DeepMind发布SL2T模型,将美国手语转成英语文本。该功能落地在Pixel 11的Gboard和Live Transcribe中,手语替代键盘打字。SL2T的测试者反馈,手语输入比英语打字更快。SL2T在Pixel 11上仅设备端追踪手、脸和身体关键点,视频不会被保留。项目由聋人谷歌员工Sam Sepah发起,并与聋人社群协作完成。AI模型SL2TPixel 11Google DeepMind4 个信源在谈事件专题推荐理由:Google DeepMind把手语变成了输入法,在Pixel 11上直接打手语就能发消息,比打字还快,聋人群体有福了。原文稍后读已读值得跟进有用关注 SL2T
21:23官方账号Demis Hassabis@demishassabis83°Google DeepMind发布了SL2T手语转文本模型。该模型支持美国手语到英语的转换,首次允许用户直接在手机上打手语而无需打字。SL2T已集成到Pixel 11的Gboard和Live Transcribe中。模型与聋人社区合作开发,旨在改善聋人和听障用户的Android使用体验。AI产品SL2TGoogle DeepMindAndroid2 个信源在谈事件专题推荐理由:Google DeepMind和Android搞了个SL2T,能把手语直接转成文字,不用打字了。Pixel 11上就能用,对聋人朋友很实用。原文稍后读已读值得跟进有用关注 SL2T
23:05官方账号Google DeepMind@GoogleDeepMindGoogle DeepMind与聋人社区合作开发了SL2T,这是一个将美国手语(ASL)输入带到手机上的技术。该项目由聋人Google员工和AI手语咨询委员会指导,旨在让手语用户能更自然地使用手机。目前SL2T仅支持ASL,团队计划将其扩展到更多手语和应用场景。AI产品SL2TGoogle DeepMind手语识别推荐理由:Google DeepMind和聋人社区一起做了个SL2T,能把美国手语直接输进手机,以后手语用户用手机就方便多了。原文稍后读已读值得跟进有用关注 SL2T
22:20官方一手Google DeepMind: Blog(博客/媒体)Google DeepMind发布手语转文字模型SL2T,为聋人和听障用户提供新功能。SL2T能将手语实时转换为文本,帮助用户更便捷地沟通。该模型基于深度学习技术,支持多种手语表达。DeepMind表示,SL2T在准确性和响应速度上均有显著提升。这一技术有望改善听障群体的数字体验。AI模型SL2TGoogle DeepMind手语识别推荐理由:Google DeepMind出了个手语转文字模型SL2T,能把手语实时变文字,聋人朋友用起来方便多了。原文稍后读已读值得跟进有用关注 SL2T
13:26官方账号arXiv cs.AI@Saad Ahmed, Md Khalid Syfullaha研究发布RSBdSL38数据集,含10,874张专家验证图像,覆盖38种孟加拉手语手型。提出的轻量注意力卷积网络仅298,470参数,在RSBdSL38上准确率达96.37%。与最优ImageNet预训练模型相比,准确率只差1.08个百分点,但参数减少8.5到68倍。模型量化后0.48 MB,在智能手机上单张推理耗时3.98毫秒。论文RSBdSL38BdSL手语识别推荐理由:孟加拉手语识别新研究:轻量模型参数少到能装进手机,准确率还够用,数据和代码都开源了。原文稍后读已读值得跟进有用关注 RSBdSL38
10:37官方账号arXiv cs.LG@Chandranath Adak, Ramesh Nandipalli该研究提出两阶段深度学习流水线:先用微调后的VideoMAE视频Transformer将手语视频片段分类为英文标签(在AI4Bharat印度手语数据集的13类子集上达到99%训练精度和78%验证精度),再用Meta的NLLB-200模型将英文标签翻译为印地语、泰卢固语和孟加拉语。实验使用13类197个片段、80-20分割,15个epoch后完成训练,并通过混淆矩阵揭示主要失败模式(如ugly/deaf/blind等形容词混淆)。研究还提供了Streamlit演示入口,支持用户上传视频并输出预测标签及三种方言翻译。论文代码已开源。论文VideoMAENLLB-200AI4Bharat推荐理由:想了解手语识别和低资源语言翻译怎么落地?这篇用VideoMAE+NLLB-200直接搭了个两阶段流水线,13类测试精度78%,还带Streamlit演示和代码。原文稍后读已读值得跟进有用关注 VideoMAE