微调 Whisper Medium 就把孟加拉语 WER 从 85% 打到 7.65%,80 多家机构一周内排队要授权,低资源语音方向的值得关注。
#数据集
同一个 Whisper Medium,换个数据集微调就把 Telugu 错误率从 92.7% 干到 16.1%,还故意保留噪声做分层,思路很值得学。
华为团队把 44 万个 GitHub 仓库和 55 万篇 arXiv 论文连起来,发现星标等信号能提前判断哪篇论文会火,精度提升 12%,数据集免费下载。
想研究 Agent 技能生态的,这个数据集直接给你 380 万份真实 SKILL.md,比你自己爬 GitHub 省事多了。
想要自动生成带精确几何图形的数学题?FormalAnalyticGeo 用 CDL 形式语言和 SDF 渲染,造出了 7000+ 带标注的解析几何题目,误差不到 1%。
越南语推荐研究缺数据?ViHoRec 提供了 18K 条跨平台高质量交互,还附带了冷启动基准,方便你对比模型在稀疏场景下的表现。
马拉地语有8300万使用者但标注数据稀缺,这个新数据集和MahaBERT模型基准很实用,适合做低资源语言NLP的朋友参考。
想做枪声分类或检测的朋友,这个 C3GD 数据集有 8000+ 现场样本、28 种枪和 16 种口径,比网上扒的数据干净多了。
Hugging Face 将存储与训练无缝集成,管理模型和数据集的团队可以直接在平台上完成从存储到训练的全流程,省去多平台切换的麻烦。
Hugging Face 联合创始人的提议直击开源 AI 在垂直领域的落地机会,建筑行业的开发者或研究者可以关注这个方向,看看能否用现有数据集推动创新。
硬件设计领域终于有了大规模开源数据集,做芯片验证或 RTL 生成的团队可以直接用这 13 万样本微调模型,省去自己爬取和标注的麻烦。建议做 EDA 工具或 AI for Hardware 的开发者点开看看。
Bigset 解决了手动收集和整理网络数据的高成本问题,适合需要快速获取结构化数据集的开发者、数据科学家或研究者,直接输入自然语言就能拿到结果,值得一试。
做具身智能或世界模型研究的团队终于有了真实物理交互数据,不再是模拟器里的完美动作——补齐了训练的关键短板,搞机器人的建议直接去 Hugging Face 下载。
做表格问答或时序预测的团队终于有了专门的数据集和框架——TimeFore用LLM+外部模型解决了LLM本身预测不准的痛点,做数据分析和AI应用的开发者可以直接参考其协作架构。
做大规模 AI 训练的团队终于可以告别下载整个数据集的痛苦——68TB 数据集 1 分钟克隆到私有存储,建议所有需要管理海量数据的开发者点开看看。
做智能体微调的团队终于有了大规模、可流式处理的开源轨迹数据,不用再自己爬取或合成。想快速上手构建 ShareGPT 格式 SFT 数据集的开发者,这篇教程可以直接照着跑。