620 个问题覆盖 6 个研究维度、31 个有效类型
先说明题库如何组织。当前每个问题继承一个原始目录标签,行业、意图、时效、风格和场景属于不同观察角度。
分类边界:31 个有效类型与 1 个未分类存量桶合计形成 32 个目录组合。未分类是数据治理状态,其中多为带年份或促销节点的高时效问题。
查看 32 类代表问题按研究维度、类型与题数展开
| 研究维度 | 问题类型 | 题数 | 代表问题 |
|---|
代表问题取每个原始类别中编号最早的实际问题;题数以 620 个标准问题为统计粒度。
Data Research · Release 2026.07
从平台规模、信源结构、问题类型、页面特征与时间新鲜度五个层面,拆解国内生成式 AI 的可观察引用模式,并形成可执行的 GEO 数据挖掘路线。
所有比例仅描述当前报告样本,点击可查看对应分析模块与分母说明。
筛选会联动带有“联动”标记的图表;平台总览类图表始终保留全量比较。
正在载入分析口径…
先理解题库的分类逻辑,再确认样本规模、字段可用性、链接可解析性和处理状态。后续每类分析按照所需字段确定样本边界。
本章用途:建立问题分类、引用观察、规范页面与分析口径之间的阅读顺序。
先说明题库如何组织。当前每个问题继承一个原始目录标签,行业、意图、时效、风格和场景属于不同观察角度。
分类边界:31 个有效类型与 1 个未分类存量桶合计形成 32 个目录组合。未分类是数据治理状态,其中多为带年份或促销节点的高时效问题。
| 研究维度 | 问题类型 | 题数 | 代表问题 |
|---|
代表问题取每个原始类别中编号最早的实际问题;题数以 620 个标准问题为统计粒度。
展示原始记录、去重记录、有效 URL 与规范页面之间的数量关系。让读者理解每一层数据粒度。
有效 URL 以 HTTP(S) 且完成规范化为准;规范页面按 canonical_url 汇总。重复观察在原始层保留,汇总层默认去重。
比较关键字段的有效值覆盖率。字段未知只限定依赖该字段的分析。
分母为 214,119 条原始引用观察;发布时间可用表示已成功规范化为日期。
按照分析所需字段计算可用比例。说明每类结论覆盖了多少记录。
引用观察统计可使用全部记录;页面、域名、标题、摘要、位置和时间分析分别应用对应字段条件。
对照 12 个平台的六类字段可用率。平台差异反映采集接口与展示能力边界。
深色表示该平台字段可用率更高。字段未知记录继续用于不依赖该字段的统计。
将常见状态映射到明确的保留、排除或复核规则,防止多个百分比被合并成一项总缺失率。
每项使用自己的分母,记录级状态与页面级状态不相加。
平台样本规模与问题覆盖存在显著差异。规模、覆盖、信源广度和单问题密度需要同时观察。
本章用途:识别各平台的引用供给强度、覆盖边界,以及同产品 Web/移动端的结构差异。
排序比较平台引用量和样本引用份额。建立平台样本权重基线。
样本引用份额的分母为 12 个平台在当前原始或精确去重口径下的引用总量,用于描述本报告样本结构,不能外推为市场份额。
比较问题覆盖数和覆盖率。约束跨平台结论的可比范围。
覆盖率分母为数据集内 620 个标准问题。
观察平台规模与信源广度关系。区分“高频集中”与“广泛覆盖”。
横轴为规范信源数,纵轴为去重引用量,气泡大小为规范页面数。
展示各平台每问题引用数的五数概括。识别典型密度与极端高值。
箱体依次表示下四分位数、中位数和上四分位数,须线表示最小值与最大值。
对照具备双端数据的产品。支持终端差异研究与采集配额规划。
移动端样本引用占比以产品双端当前口径引用合计为分母;问题覆盖差以电脑端覆盖问题数为分母。只纳入同时存在电脑端与移动端记录的产品家族。
9,878 个规范信源已经形成完整的一级类型地图。域名规模、引用贡献、主体自有来源渗透、头部集中与生态归属共同解释信源供给结构。
本章用途:先判断各类信源在生态中的规模与影响,再识别平台偏好、稳定信源和新增内容进入头部生态的难度。
对照每个一级类型的域名占比和去重引用占比。识别少量域名形成高影响的集中型供给,以及域名多、单站贡献分散的长尾型供给。
正在载入逐域治理范围…
类型结构使用可关联规范域名的信源表去重引用作为分母。主体自有来源包括品牌与企业官网、政府与公共机构。
把各平台去重引用拆分为品牌与企业官网、政府与公共机构两部分,并以平台全部去重引用作为分母。用于观察不同平台对主体自有信息的可见依赖程度。
正在载入平台差异与置信度敏感性…
按当前筛选条件展示头部信源,并同时显示样本引用份额。形成平台级信源优先名单。
样本引用份额使用当前平台、信源类型和记录口径下的全部可关联信源引用作为分母;问题覆盖率使用当前筛选集合覆盖的问题数作为分母。图中仅展示 Top 20,分母保留完整集合。
比较二级信源类型的引用规模和样本构成率。观察一级生态内部的内容角色、服务形态和平台差异。
构成率以当前平台和记录口径的全部类型引用合计为 100%。全库逐域治理包含 500 个人工复核、55 个历史映射、8,644 个模型辅助标注和 679 个政府域名规则分类。
展示信源排名与累计引用份额。评估头部集中度和长尾扩展空间。
累计份额按精确去重引用量排序计算。
对照头部信源的平台分布。寻找平台偏好与跨平台扩展线索。
选取全局去重引用量最高的 16 个信源;颜色为平台内去重引用数。
对照已归属生态规模,并拆解生态归属空缺长尾的头部与低频结构。
“未归属生态”仅描述集团或内容生态标签尚未标注。信源类型分类覆盖与未分类长尾见 03.1。
以八端共同问题建立公平基线,再以豆包和 DeepSeek 四个高活跃端点的头部信源作为锚点,观察元宝与千问的承接情况,并展开各端真实 Top 10/20 排行、终端倾向和一级类型构成。Kimi 不进入本章的数据、筛选和结论。
本章用途:识别核心信源的跨产品迁移机会,对照每个端点的真实头部结构,并形成面向具体产品和终端的 GEO 信源初筛名单。
以八端平均占比为 100,比较筛选达标信源在各端点的相对权重。点击有引用的单元格或使用键盘选择器可联动锁定信源。
每个问题先在可识别信源中归一化,再按问题等权汇总。八端偏好指数的理论范围为 0 至 800;矩阵从筛选达标信源中展示跨端差异度最高的 20 个,颜色在指数 200 处封顶,悬停显示实际指数、引用量和覆盖问题数。极高指数可能来自较小覆盖样本,需要结合明细读取。窄屏可横向滑动图表。
合并豆包电脑端、豆包移动端、DeepSeek 电脑端和 DeepSeek 移动端各自 Top 10,得到 17 个去重锚点,再观察这些信源在元宝与千问双端的排名和份额。
锚点继承率 = 进入当前端点 Top 20 的锚点数 ÷ 17。单元格数字为共同问题口径下的真实排名,点号表示未进入该端完整信源排行;悬停还可查看该信源在四个锚定端的 Top 10 出现率。
共同问题使用 334 个八端均有可识别信源的问题,适合横向公平比较;全量范围使用各端全部有效信源问题,呈现端内真实分布。
份额先在单个问题内按可识别信源归一化,再对问题等权汇总。选择产品时保留八端完整结构,并突出对应双端。点击其他产品列的信源会自动切换产品范围,同一 source_id 随后在矩阵、终端倾向和 GEO 清单同步高亮。
使用双端均有可识别信源的共同问题,比较信源在电脑端和移动端的等权占比。全部产品模式展示每个产品差异最大的信源。
左侧为电脑端,右侧为移动端。全量重合度使用共同问题内出现过的全部可识别信源;达标重合度仅保留累计不少于 20 条去重引用且覆盖不少于 5 个问题的信源。两层口径用于区分长尾差异和稳定信源差异。
把每个终端的等权引用占比分解为九个一级分类,并单列信源未规范化记录。悬停可继续查看一级分类中的二级类型构成。
每个终端合计为 100%。一级分类保证跨端可读性,二级类型保留主体与内容形态细节。150 个证据仍不足的域名保留“未分类长尾”;无法关联规范域名的记录单列为“信源未规范化”。
汇总信源在具体产品中的优势终端、倾向强度和共同问题覆盖率,形成内容研究与终端专项验证名单。全部产品模式为每个产品保留 5 个候选。
| 信源 | 产品 | 优势终端 | 终端倾向指数 | 终端差异 | 覆盖问题 | 共同问题覆盖率 | 去重引用 | 初筛建议 |
|---|
共同问题覆盖率 = 信源覆盖问题数 ÷ 该产品双端均有可识别信源的问题数。终端倾向指数以产品双端平均值为 100,范围为 100 至 200。双端份额相对差不超过 15% 时标记为接近;指数不低于 150 且覆盖少于 15 个问题时标记为高倾向低覆盖;其余信源按份额较高的终端进入专项验证。Kimi 不进入本章计算、筛选和结论。
跨平台共享的“问题与页面”组合整体有限,少数平台对具有更高重合。共识信源因此更适合作为跨平台策略起点。
本章用途:区分平台独有供给、平台间共享供给和跨平台共识信源。
比较任意两个平台的 Jaccard 相似度。定位最接近的平台对与相对独立的平台。
Jaccard = 共享问题与页面组合数 ÷ 两平台问题与页面组合并集;0 表示没有共享组合,对角线表示平台自身。
把相似度转为关系网络。观察平台簇与桥接节点。
只显示相似度高于样本中位数且大于 0 的连接,线宽随相似度增加。
排序展示共享组合数量。筛选适合做迁移验证的平台对。
图中展示共享组合数最高的 16 个平台对。
分解各平台共享与独有组合。估算单平台专项优化的必要性。
共享表示同一问题与同一规范页面同时出现在至少两个平台。
综合信源的平台数和问题数。形成跨平台优先合作与内容研究名单。
共识分数 = 覆盖问题数 × 覆盖平台数,仅用于本数据集内筛选。
620 个问题按照来源分层映射到七类维度。不同标签的引用密度、信源多样性和平台供给具有独立结构。
本章用途:把平台与信源研究落到具体需求场景,建立按问题类型分层的数据挖掘单元。
呈现维度与标签的结构。避免把不同分层误当成同一套全量标签。
面积表示标签内问题数;当前版本每个问题只保留其来源分层对应的一个标签。
比较当前维度的标签引用规模和题均引用。筛选高供给与低供给场景。
题均引用以标签内标准问题数为分母;悬停同步展示题均信源、题均页面和题均平台数。
比较当前问题维度在 12 个平台上的引用量。定位平台场景优势和采集空白。
颜色为当前口径下的引用观察数;样本覆盖差异需与第 2 章结合阅读。
对照每个标签按问题先聚合后计算的题均信源数与题均页面数。识别供给集中和内容补位空间。
横轴为单问题不同规范信源数的标签均值,纵轴为单问题不同规范页面数的标签均值,气泡大小为标签问题数。
列出当前维度或标签的高频信源。支持页面拆解和信源合作优先级。
| 信源 | 标签 | 去重引用 | 覆盖问题 |
|---|
选择具体问题标签时显示该标签前 8 位;选择全部时展示当前维度的代表性信源。
本章以页面标题中的可观察信号为基础,将每个页面归入一个主要内容类型,并同时保留可重叠的多项标题特征。当前数据未包含完整正文,分类结果用于结构研究和样本筛选。
本章用途:先建立内容类型与标题特征地图,再用真实标题解释规则,并对照长度、平台差异、页面覆盖和特征共现。
比较互斥主类型的页面量与引用表现。点击条形可在下方查看真实标题。
每个页面按固定优先级归入一个主类型;标题未提供页面独立保留。分类版本为 deterministic_v2。
比较 11 项标题特征在标题可用页面中的覆盖率。点击条形可查看触发该特征的标题。
规则基于关键词、年份和问号模式;分母为 已提供标题的页面。
按主类型或标题特征浏览代表页面。实例保留原始标题,并补充域名、问题覆盖和平台覆盖。
实例筛选条件:标题长度 12 至 62 个字符、至少覆盖 2 个平台、覆盖 2 至 15 个问题,并优先保留不同域名。实例用于解释规则,不代表内容质量背书。
比较标题长度区间的页面量与平均引用。为标题结构实验提供区间参考。
标题未提供为独立区间;相关性用于筛选,未控制平台、主题和域名权重等混杂因素。
比较摘要长度与页面平均引用。为正文抓取优先级提供线索。
摘要未提供为独立区间;max_snippet_length 是同一规范页面的最大引用摘要长度。
对照平台级页面特征覆盖率。识别时效、决策、商业、可信度和地域表达的差异。
分母为各平台去重引用涉及且标题已提供的不同规范页面数。
气泡图呈现问题数、平台数与引用量,右侧直接列出五个全库代表页面。
气泡大小为精确去重引用数;标题列表按问题覆盖数与平台覆盖数的乘积排序。
比较共同页面量最高的 14 组特征对,并以 Jaccard 系数衡量共现强度。
Jaccard = 共同页面数 ÷ 至少包含其中一项特征的页面数。特征对用于描述共同出现,不承载因果结论。
107,659 个规范页面中,63,314 个拥有一致发布时间,43,675 个时间未知,670 个存在日期冲突。已知时间页面主要集中于 2025 和 2026。
本章用途:先确认时间字段覆盖,再分析已知时间样本内部结构,并把未知与冲突页面保留在其他适用分析中。
按月拆解拥有唯一一致日期且不晚于数据截止日的页面,识别发布时间样本的新鲜内容重心、月度拐点和异常日期。
月度特征2025 年下半年承载该年主要发布时间样本;2026 年 5 月出现跨平台峰值,6 月回落后仍高于 4 月。该序列描述被引用页面的发布时间构成,不代表全网内容生产量。
主图展示 2024 年 1 月以来的连续月份,覆盖截止日前可靠日期样本的 94.7%。发布时间未知和日期冲突页面不进入月度序列;晚于数据截止日的日期单列为异常,不进入趋势计算。
同时展示全体页面状态和已知时间样本内部构成。建立内容更新与存量分析口径。
图中同时标注占全部页面比例;已知时间段额外显示其在 63,314 个可靠时间页面中的占比。
比较当前问题维度内各标签的时间状态占比。识别高时效场景的旧内容与补采空间。
每行以该标签的问题与页面关联总数为 100%,悬停显示占比和关联数。
比较主要信源类型的时间状态占比。判断更新型内容、常青内容和字段覆盖差异。
每类信源以自身页面数为 100%;展示页面量最高的 12 类信源。
审计标题年份和发布时间的一致性。日期冲突与未知状态独立呈现。
标题取首个四位年份;年份一致只表示标题年份与唯一页面日期年份相同。
机会筛选同时考虑已有覆盖强度、平台覆盖缺口、问题供给密度和内容形态。所有评分用于形成候选队列,后续仍需人工验证。
本章用途:把描述性分析转成信源扩展、场景补位、内容模板和跨平台迁移四类行动清单。
按问题覆盖率和平台渗透率定位信源。区分共识型、平台型与长尾型信源。
问题覆盖率以 620 个标准问题为分母,平台渗透率以 12 个平台为分母;虚线分别位于问题覆盖率 6.5%(40 个问题)和平台渗透率 50%(6 个平台),气泡大小为精确去重引用量。
列出当前平台未覆盖的高潜信源。设计跨平台迁移验证清单。
| 候选信源 | 类型 | 现有平台 | 问题数 |
|---|
全部平台模式展示综合候选;选择具体平台后展示该平台空白。
比较每问题引用量与每问题页面量。筛选需求密集、供给相对集中的场景。
右上表示高需求高供给;左上更适合作为新增页面的初筛方向。
比较各平台每种内容形态的每页引用数。为平台定制内容模板提供候选依据。
单元格 = 去重引用数 ÷ 不同规范页面数;页面量较小时需谨慎解读。
综合问题覆盖率、平台渗透率和平台空白率。生成跨平台扩展候选队列。
筛选分 = 覆盖问题数 ×(12 − 已覆盖平台数),用于保持原有排序;条形标签补充平台空白率,悬停显示问题覆盖率和平台渗透率。
本报告提供一套可以反复更新的分析骨架:平台比较、信源分层、场景拆解、页面特征和机会筛选均可随新数据版本重算。
本章用途:把当前发现转成下一轮数据采集、内容研究和 GEO 实验的执行顺序。
优先对问题覆盖接近的电脑端与移动端产品做配对比较;引用序号只在平台内部使用。
建立跨平台共识、产品与终端特色、空白候选三类信源名单,并按月复算。
从高问题覆盖页面抽样抓取正文,补充结构、实体、事实密度、表格和作者权威性特征。
按研究目的补充响应边界、模型版本、采集时间和页面正文;发布时间作为时间分析的可选增强字段。