做视觉生成模型训练的研究者终于有了一个大规模、开放许可、可直接商用的数据集,不用再为版权和合规问题头疼。建议做图像生成、扩散模型或流匹配的团队直接下载使用。
#数据集
共 54 条 · 7 天 1 条 · 30 天 7 条
5月29日
GPIC:28万亿像素的开放许可图像数据集,用于视觉生成
5月28日
产品22:11
Jasper发布MONET数据集:1.05亿图文对,最大开源文生图数据集做文生图研究的团队终于有了一个大规模、去重、重新标注的开源数据集,可以直接用于训练和复现实验,建议点开看看数据集和代码库。
5月27日
FineVLA:细粒度指令对齐实现可操控的视觉-语言-动作策略
做机器人策略学习和 VLA 模型的研究者终于有了可用的细粒度数据框架——FineVLA 不仅开源了 47K 条验证轨迹和基准,还证明了细粒度指令能显著提升操控精度,做双臂操作或仿真迁移的团队可以直接用。
5月22日
产品22:53
CommonCrawl 推荐 Hugging Face Buckets 处理大型训练数据集CommonCrawl 的背书说明 Hugging Face Buckets 在大规模数据管理上靠谱,做 NLP 或预训练数据处理的团队可以直接试试,省去自己搭存储的麻烦。
产品07:40
Mem0 推出 AGENTRUSH:AI 智能体专属 7 天记忆竞赛这是首个纯 AI 智能体间的记忆竞赛,做智能体开发或研究记忆机制的团队值得关注——它直接测试智能体在无人类干预下的协作与记忆价值判断能力,结果数据集可能成为未来智能体记忆研究的基准。
5月21日
BioDefect:首个生物信息学软件缺陷检测数据集
做生物信息学软件质量保障的团队终于有了专用数据集——BioDefect 比通用数据集 F1 提升近 40%,做缺陷检测研究的可以直接用它来训练和评估模型。
5月20日
ThoughtTrace:首个大规模用户思维数据集,揭示LLM交互中的真实想法
做对话AI研究和产品开发的团队,终于有了一个能捕捉用户真实想法的数据集——ThoughtTrace帮你理解用户为什么发那条消息、对回复的真实感受,值得用来改进助手对齐和个性化。
MediLongChat:合成长期医疗对话数据集,评估AI记忆能力
医疗AI开发者终于有了一个能真正测试长期记忆能力的基准——MediLongChat让跨会话推理变得可评估,做医疗对话系统的团队建议直接拿来跑跑看。
5月19日
MixCount数据集:弥合开放词汇目标计数的数据鸿沟
做工业检测或产品分拣的团队,终于有专门针对混合物体场景的计数数据集了——用自动生成流水线解决标注难题,直接训练就能让模型在真实场景中MAE降20%,值得一试。
5月13日
5月12日
5月11日
产品22:16
UFO数据集现已上线Hugging Face,谁将训练首个CV模型?UFO数据集作为非传统视觉数据资源,为CV研究者提供了探索异常检测、低置信度场景的新材料,有助于推动AI在开放世界感知中的鲁棒性研究。