github.com · VERIFIED WEBSITE

国内 AI 引用偏好数据集

面向国内生成式 AI 引用研究的开放数据包,提供 214,119 条原始记录、结构化格式、质量报告与交互分析入口。

访问网站
9.7编辑综合评分
访问正常技术访问状态
中文界面语言支持
开源免费付费模式
国内 AI 引用偏好数据集 网站页面截图
页面截图 · 最近核验于 2026.07.25

资源介绍

REVIEWED · 2026.07.24

国内 AI 引用偏好数据集当前标记为 2.0.1 版,发布于 2026 年 7 月 14 日。数据包包含 214,119 条原始引用记录、64 个 JSONL 分片、620 个研究问题、12 个平台或终端代码、9,878 个规范化来源与 107,659 个页面,并保留 24,274 条完全重复观察以维持原始总体口径。

仓库同时提供 JSONL、Parquet、DuckDB、数据字典、质量报告和交互式可视化报告,适合用来比较平台信源偏好、官网来源渗透、引用集中度、问题属性和内容形态。稳定记录标识与校验文件也便于团队做分批下载、复现分析和版本间对比。

完整数据约 409 MB,原始分片约 267 MB,使用前应先确认本地存储、内存和分析工具。第三方页面信息受原站点权利与使用条款约束,平台代码也只代表该采集体系中的观察对象。发表结论时应注明版本、采样日期、去重规则、缺失值和许可范围。

适合:研究国内 AI 搜索信源、引用生态和 GEO 效果的数据团队与研究人员

使用场景

BEST FIT
  1. 分析国内 AI 平台的信源与引用偏好面向国内生成式 AI 引用研究的开放数据包,提供 214,119 条原始记录、结构化格式、质量报告与交互分析入口。
  2. 复现引用生态报告并建立自有监测面板面向国内生成式 AI 引用研究的开放数据包,提供 214,119 条原始记录、结构化格式、质量报告与交互分析入口。

极简评分

EDITORIAL SIGNALS
01 / SCORE

编辑评分 9.7

综合功能、上手成本、实际价值与长期可用性。

02 / USABILITY

易用性 9.0

从首次打开到完成核心任务的学习成本。

03 / FEATURES

功能度 9.8

核心能力与真实工作场景的覆盖程度。

04 / VALUE

价值度 9.7

价格模式、免费范围与长期使用价值。