01:58AI Will@FinanceYF5精选Harvey在Sovereign AI活动上分享了开源数据集和建设低成本研究实验室的经验,包括法律代理、合成数据生成、模型服务矩阵等内容。论文Harvey开源数据集研究实验室推荐理由:Harvey分享开源数据集,低成本建设研究实验室的经验值得学习。原文稍后读已读值得跟进有用关注 Harvey
15:01量子位@鱼羊新智具身与复旦大学联合发布三份触觉数据相关报告。报告包含总计3万小时的触觉数据,全部开源。该数据用于训练具身智能的精细触觉感知能力。论文新智具身复旦具身智能推荐理由:搞具身智能的团队,想给机器人加上手感,直接拿新智具身和复旦开源的3万小时触觉数据去训练,省时省力。原文稍后读已读值得跟进有用关注 新智具身
17:17Yangyi@Yangyixxxx精选76°姚金刚与好友拔刀刘开源了国内8个AI平台(豆包、DeepSeek、元宝、千问、Kimi、文心、百度AI等)的搜索数据集,包含620个标准问题、214,119条AI引用观察,去重后保留189,845条。数据覆盖6个研究维度、31种问题类型,引用来源归并为9,878个规范域名、107,659个规范页面。初步分析显示,Top10信源贡献了41.47%的去重引用,抖音、腾讯网、今日头条、百度百科排前四;平台与社区类信源仅占4.68%域名却获29.63%引用。跨平台Jaccard相似度最高仅34.94%,表明各平台引用偏好差异显著。行业姚金刚AI搜索开源数据集推荐理由:这批数据太香了,覆盖豆包、DeepSeek、Kimi等8个平台的搜索引用,21万条记录随便分析,搞AI搜索和信源生态的别错过。原文稍后读已读值得跟进有用关注 姚金刚
05:24Thomas Wolf@Thom_WolfMultimodal Universe 项目在 Hugging Face 上发布 80TB 天体物理数据集,整合了 SDSS 和 Gaia 等 30 多个来源的数据。该数据集包含星系光谱、恒星时间序列及多种物理量,通过交叉匹配技术实现高效查询。用户仅需约 4GB RAM 即可在笔记本上处理 800k 与 122M 个天体的匹配。该发布有望将天文数据的可及性提升万倍。行业Hugging FaceSDSSGaia推荐理由:Hugging Face 上悄悄放了 80TB 天文数据,用你笔记本就能跑 SDSS 和 Gaia 交叉匹配。搞 AI for Science 的话别错过,比想象中好上手。原文稍后读已读值得跟进有用关注 Hugging Face
03:47官方一手Google Research: Blog(资讯)Google Earth AI团队将Heat Resilience数据集的覆盖范围扩大到全球50多个城市。该数据集采用开源模型与数据集许可,提供高分辨率城市热环境指标。社区可利用该数据评估城市热岛效应,制定适应性措施。AI模型Google ResearchEarth AIHeat Resilience1 个信源在谈事件专题推荐理由:Google把热弹性数据做到50+城市了,开源可下载,做城市热岛分析直接拿数据,不用自己算。原文稍后读已读值得跟进有用关注 Google Research
00:30官方账号Clement Delangue@ClementDelangue74°XDOF宣布完成7000万美元融资,投资方包括多家未披露的投资者。该公司由来自Covariant、Meta和Tesla的团队创立,专注于为机器人基础模型构建核心基础设施。同时,他们开源了ABC-130K数据集,这是目前最大的开源遥操作数据集,与UC Berkeley、CMU、MIT和Amazon FAR合作开发。该数据集可帮助研究人员和公司更高效地训练机器人基础模型。行业XDOFABC-130KHugging Face推荐理由:XDOF拿了7000万美金做机器人基础模型,还开源了130K的遥操作数据集,搞机器人训练的朋友赶紧去用。原文稍后读已读值得跟进有用关注 XDOF
09:07官方一手GitHub Blog@Natalie GuevaraGitHub发布了一个新的repository-level数据集,许可证为CC0-1.0,包含多语言开发者内容,涵盖README、issues和pull requests。该数据集旨在帮助研究人员和开发者训练或改进多语言AI模型。数据集中于2025年4月发布,可直接下载使用,无需额外申请。AI模型GitHub多语言AI开源数据集推荐理由:GitHub新出的多语言数据集,免费开源,里面各种语言的README和讨论都有,做多语言AI模型训练正好用上。原文稍后读已读值得跟进有用关注 GitHub