这批数据太香了,覆盖豆包、DeepSeek、Kimi等8个平台的搜索引用,21万条记录随便分析,搞AI搜索和信源生态的别错过。
姚金刚与好友拔刀刘开源了国内8个AI平台(豆包、DeepSeek、元宝、千问、Kimi、文心、百度AI等)的搜索数据集,包含620个标准问题、214,119条AI引用观察,去重后保留189,845条。数据覆盖6个研究维度、31种问题类型,引用来源归并为9,878个规范域名、107,659个规范页面。初步分析显示,Top10信源贡献了41.47%的去重引用,抖音、腾讯网、今日头条、百度百科排前四;平台与社区类信源仅占4.68%域名却获29.63%引用。跨平台Jaccard相似度最高仅34.94%,表明各平台引用偏好差异显著。
牛且专业
牛且专业 姚金刚 @yaojingang 经好友拔刀刘同意,将他们近期抓取的国内各大AI平台数据集进行开源 清洗后的数据集、论文预印本以及第一份分析报告,已推送到GitHub仓库,地址见评论区 这应该是面向国内各大AI平台的最新、最全的一份公开GEO原始数据集 包括了豆包、DeepSeek、元宝、千问、Kimi、文心、百度AI等8个AI平台的AI搜索结果、信源特征数据 这份数据包括: 1、620 个标准问题,覆盖 6 个研究维度、31 种有效问题类型,包括行业、提问意图、提示风格、时间敏感度、触发强度和极端真实场景; 2、214,119 条 AI 引用观察,精确去重后保留 189,845 条。这里统计的是回答中的引用来源与摘要,现有数据不含完整回答原文; 3、引用记录归并为 9,878 个规范域名信源、107,659 个规范页面;211,248 条记录带有效 HTTP URL,占 98.66%; 4、信源按 9 个一级类型、39 个二级类型完成分类,去重引用的分类覆盖率达到 99.77%; 5、原始数据、清洗表和分析集市都已保留,可用 JSONL、Parquet 和 DuckDB 直接查询,也附了字段字典、清洗规则和质量报告; 6、64 个原始分片全部通过 SHA-256 校验,清洗过程保留原值、异常标记和追溯字段,方便复现和继续加工 这几天对数据进行了二次清洗、标注和加工,并输出第一份可视化分析,一些有意思的发现和洞察 1、各大AI平台的信源头部效应非常明显,Top 10 信源贡献了 41.47% 的去重引用,抖音、腾讯网、今日头条、百度百科排在前四 2、平台与社区类信源只占 4.68% 的域名,却拿到 29.63% 的去重引用,内容分发平台在 AI 引用生态里的权重很高 3、品牌与企业官网只贡献 4.33% 的去重引用;加上政府与公共机构,主体自有来源合计 9.06%。品牌自有内容还有很大的可见度空间 4、跨平台共识并没有想象中高,66 个平台组合中,最高的“问题 × 页面”Jaccard 相似度也只有 34.94%,还有 11 个组合完全没有共享的问题与页面。单个平台的经验不能直接外推到其他平台 5、内容新鲜度很明显,在发布时间可靠的页面中,88.77% 来自 2025 或 2026 年;29.57% 的页面标题带年份,23.06% 带榜单或排行。时效信号和决策型内容值得继续验证 欢迎留言补充关心的问题,我可以抽空基于这些关心的问题,再做一份数据分析报告 🔗 View Quoted Tweet 💬 1 🔄 0 ❤️ 0 👀 289 📊 1 ⚡