8月25日
10:55
10:55官方账号arXiv cs.AI@Md Thamed Bin Zaman Chowdhury, Moazzem Hossain
针对低资源国家道路交通事故问题,提出EGD框架,将道路安全专家知识转化为视觉语言模型,实现可扩展的道路安全审计。BD-ARSA数据集包含21,947条图像审计记录,EG-ARSA模型在风险评估上优于其教师模型和Gemini-2.5-Flash模型。
推荐理由:EG-ARSA模型基于专家知识,有效解决低资源环境下的道路安全审计问题,是Gemini-2.5-Flash模型的升级版。
03:34
8月19日
11:47
11:47官方账号Anthropic@AnthropicAI
71°
Anthropic发布了最新技术报告,详细介绍了其AI系统的设计原理。该公司同时开源了提示词和数据集,位于Hugging Face平台。技术报告可在Anthropic官网获取,包含系统架构和训练方法细节。
事件专题

推荐理由:Anthropic开源了提示词和数据集,还发布了技术报告,想了解他们AI系统设计的可以看看。
8月6日
09:33
09:33官方账号arXiv cs.AI@Jacob Arndt, Debvrat Varshney, Philipe Dias, Nivedita Nukavarapu
该论文提出一个用于卫星图像篡改检测与定位的原型基准数据集,包含60张图像,其中30张经复制粘贴拼接或扩散模型修复等方式篡改,另30张为真实图像。每张图像都配有像素级真值掩码和采集元数据,支持定位性能评估。数据集已发布在HuggingFace平台,可免费下载。
推荐理由:遥感领域缺精细的篡改定位数据集,这个原型集合了拼接和扩散修复两类篡改,还带掩码和元数据,做取证研究可以直接拿来测。
7月23日
02:45
7月15日
7月1日
10:55
10:55官方账号arXiv cs.LG@Max Whitton, Zecheng Wang, Puchen Liu, Quang Tuan Truong, Shengao Wang, Manaswi Yadamreddy, Oktay Ozel, Visista Jayanti, Saniya Sekhon, Hanna Samuel Tadesse, Lawrence Miao, Junjie Wang, Jiasen Lu, Chen Yu, Boqing Gong
该论文提出一种婴儿触摸事件的结构化编码系统,并构建了包含264k个两秒片段的触觉事件数据集。利用该数据集预训练的发展性模型揭示了触觉在婴儿视觉概念学习中的重要作用。研究量化了婴儿依赖触觉进行视觉学习的程度,为理解触觉在认知发展中的角色提供了依据。
推荐理由:这篇论文用264k个婴儿触觉片段做对比学习,发现触觉对视觉学习的贡献比想象中大,推荐给研究婴儿认知或对比学习的读者。
6月30日
6月26日
10:21
10:21官方账号arXiv cs.LG@MSVPJ Sathvik, Parmitha Vangapadu, Nishit Rane, Sathwik Narkedimilli, Mark Lee, Akrati Saxena
研究人员提出了 BetXplain 数据集,包含从 Instagram 和 Reddit 收集的赌博广告,并手动标注了操纵性和欺骗性广告行为。每个标注附带人类提供的解释,支持可解释的检测方法研究。分析揭示了赌博广告常用说服策略及其对用户心理健康的潜在影响。该框架可用于开发浏览器插件和自动爬虫,辅助监管机构监测操纵性广告。
推荐理由:新数据集 BetXplain 专治社交媒体上的忽悠型赌博广告,带人工解释,能帮你研究怎么自动识别这种坏广告。
6月24日
11:52
11:52官方账号arXiv cs.LG@Hariom Ingle, Ronit Ghode, Ishwari Gondkar, Jidnyasa Harad, Raviraj Joshi
L3Cube-MahaPOS是首个大型人工标注的马拉地语词性标注数据集,包含32,354句新闻文本,遵循16标签Universal Dependencies方案。研究在HMM、CRF、BiLSTM、BiLSTM+CharCNN、MuRIL和MahaBERT-v2六类模型上进行了基准测试。最佳模型MahaBERT-v2达到88.67%的token级准确率和81.67%的宏F1分数。该数据集和模型检查点已开源,可助力马拉地语NLP研究。
推荐理由:马拉地语有8300万使用者但标注数据稀缺,这个新数据集和MahaBERT模型基准很实用,适合做低资源语言NLP的朋友参考。
6月23日
01:03
01:03官方账号Clement Delangue@ClementDelangue
HuggingFace 平台上的公开模型数量即将突破300万个,公开数据集也即将达到100万个。该平台已成为开源AI社区的核心枢纽,模型和数据集数量在过去一年快速翻倍。这一里程碑反映了开源AI生态的持续繁荣。
推荐理由:HuggingFace 马上要突破300万模型和100万数据集了,这说明开源AI有多火。看看这个数字,社区力量真强。
6月18日
10:57
10:57官方账号arXiv cs.LG@Denis Peskoff, Joe Barrow, Christopher Vu, Diag Davenport
LOCUS是美国首个大规模地方法规语料库,收录9,239个市县的法典。该数据集通过OCR处理了多种文档格式,覆盖3,144个县中的2,309个,覆盖多数美国人口。研究团队训练了基于ModernBERT的分类器,用于分析法规的模糊性和家长主义等维度。LOCUS-v1及其衍生模型已在Hugging Face上开源。
推荐理由:法律AI研究者有福了!LOCUS提供了9,239个美国地方法规的机器可读语料,还附带了基于ModernBERT的分析工具,解决碎片化问题。
6月16日
11:23
11:23官方账号arXiv cs.AI@Aleksander Szczęsny, Wiktoria Mieleszczenko-Kowszewicz, Maciej Markiewicz, Beata Bajcar, Tomasz Adamczyk, Jolanta Babiak, Grzegorz Chodak, Przemysław Kazienko
IMPACTeen 数据集包含 1021 个文本和 5100 条注释,覆盖人际、媒体和数字场景下的青少年社交影响。每个文本由青少年、家长、心理专家、传播专家和教师五个视角进行标注。数据集通过约束 LLM 生成后经人工编辑验证,确保场景真实性。它支持社会影响力检测、标注者分歧分析和跨语言建模等研究。原始数据为波兰语,并附有英语版本。
推荐理由:想做青少年社交影响力检测?这个数据集有1021个文本和五方标注,还能跨语言用。
6月12日
01:36
6月3日
6月2日
5月30日
08:48
08:48官方一手marktechpost@Sana Hassan
精选72°
AgentTrove 是目前最大的开源智能体交互轨迹数据集,包含 170 万条 ShareGPT 格式的记录。本文提供了一份详细的 Python 教程,演示如何在不完全下载的情况下流式读取数据集、标准化智能体对话轮次、提取命令、分析轨迹,并最终将成功的交互轨迹导出为干净的 SFT 微调数据集。这对于需要高质量智能体训练数据的开发者来说非常实用。
推荐理由:做智能体微调的团队终于有了大规模、可流式处理的开源轨迹数据,不用再自己爬取或合成。想快速上手构建 ShareGPT 格式 SFT 数据集的开发者,这篇教程可以直接照着跑。
5月29日
11:06
11:06官方账号arXiv cs.AI@Keshigeyan Chandrasegaran, Kyle Sargent, Suchir Agarwal, Michael Jang, Michael Poli, Juan Carlos Niebles, Justin Johnson, Jiajun Wu, Li Fei-Fei
精选72°
斯坦福大学发布GPIC(Giant Permissive Image Corpus),一个包含约28万亿像素、1亿训练样本的开放许可图像数据集。所有图像均采用宽松许可,可自由用于研究和商业用途,并经过安全过滤和去重处理。数据集托管在Hugging Face上,附带基准测试协议和像素空间流匹配的参考基线。这为视觉生成模型的可扩展研究提供了稳定、大规模且合规的数据基础。
推荐理由:做视觉生成模型训练的研究者终于有了一个大规模、开放许可、可直接商用的数据集,不用再为版权和合规问题头疼。建议做图像生成、扩散模型或流匹配的团队直接下载使用。
5月27日
10:34
10:34官方账号arXiv cs.AI@Xintong Hu, Xuhong Huang, Jinyu Zhang, Yutong Yao, Yuchong Sun, Qiuyue Wang, Mingsheng Li, Sicheng Xie, Yitao Liu, Junhao Chen, Yixuan Chen, Yingming Zheng, Shuai Bai, Tao Yu
精选72°
现有机器人数据集通常只提供粗粒度的目标级语言描述,缺乏执行细节(如活动臂、接近方向、接触区域),限制了策略的可操控性。FineVLA 提出了一个开放框架,包括数据构建工具、细粒度数据集 FineVLA-Data(47,159 条轨迹)、基准测试、专用 VLM 标注器和可操控策略。实验表明,细粒度监督不仅不牺牲目标级成功率,还能提升 1.4-8.1 个百分点,且与粗粒度指令互补,最佳混合比例(FG:Raw=1:2 至 1:1)在仿真和真实场景中均取得最高性能。细粒度监督在姿态、颜色和接近方向等关键因素上带来最大真实世界增益,建议用细粒度语言补充目标级指令。
推荐理由:做机器人策略学习和 VLA 模型的研究者终于有了可用的细粒度数据框架——FineVLA 不仅开源了 47K 条验证轨迹和基准,还证明了细粒度指令能显著提升操控精度,做双臂操作或仿真迁移的团队可以直接用。
5月22日
22:53
22:53官方账号Clement Delangue@ClementDelangue
CommonCrawl 公开推荐并使用 Hugging Face Buckets 来管理大型且不断演变的训练数据集。Hugging Face Buckets 是一种存储解决方案,专为处理私有模型或数据集而设计。该工具旨在简化大规模数据管理流程,提升效率。Hugging Face 创始人呼吁用户尝试并反馈意见。

推荐理由:CommonCrawl 的背书说明 Hugging Face Buckets 在大规模数据管理上靠谱,做 NLP 或预训练数据处理的团队可以直接试试,省去自己搭存储的麻烦。
5月21日
5月20日
15:54
15:54官方账号arXiv cs.AI@Chuanyang Jin, Binze Li, Haopeng Xie, Cathy Mengying Fang, Tianjian Li, Shayne Longpre, Hongxiang Gu, Maximillian Chen, Tianmin Shu
精选
现有AI对话数据集仅记录用户说了什么,但忽略了用户在想什么。ThoughtTrace是首个大规模数据集,包含1,058名用户、2,155次对话、17,058轮交互和10,174条思维标注,覆盖20种语言模型。研究发现,用户的思维与消息内容在语义上截然不同,前沿LLM难以从上下文中推断,且思维内容多样、与对话阶段相关。该数据集可用于改进用户行为预测和训练个性化助手,为构建更理解用户潜在目标的AI系统奠定基础。
推荐理由:做对话AI研究和产品开发的团队,终于有了一个能捕捉用户真实想法的数据集——ThoughtTrace帮你理解用户为什么发那条消息、对回复的真实感受,值得用来改进助手对齐和个性化。