
admin
作者
Google不收录页面怎么排查:发现、抓取与质量诊断
直接答案:通过服务器日志、Search Console和索引状态API区分六种未收录类型,按优先级顺序验证技术可抓取性。
技术可抓取性验证
步骤1:确认发现状态
- 记录字段:服务器日志中的Googlebot IP段(需验证归属)、Search Console「网址检查」工具的「已发现」状态时间戳
- 判断标准:若过去30天内无Googlebot访问记录且Search Console显示「未发现」,则进入服务器诊断流程
- 例外:动态生成页面可能需要主动提交;JavaScript渲染内容需检查渲染后HTML是否出现在日志中
- 验收方式:在日志中捕获包含目标URL的200状态码Googlebot请求
步骤2:检查抓取可行性
- 核心验证矩阵:
检查项:通过标准;失败处理
robots.txt规则:目标URL路径未被Disallow;修正规则后使用测试工具验证
服务器状态码:持续返回200/304(非5xx/403/401);排查CDN配置或服务器错误日志
canonical标签:指向自身或不存在;修正跨域名或子版本错误指向
加载时间:首字节时间<1.5秒;优化服务器响应或静态化资源
结构化数据错误:无影响索引的严重错误;修复但不影响核心收录流程
步骤3:诊断索引阻断
- 关键证据链:
- Search Console「覆盖率报告」中的「已提交未索引」数量
- 索引状态API返回的
indexingState字段值为INDEXING_ALLOWED - 页面无
noindex元标签或HTTP头
- 例外处理:
- 若存在「重复页面」标记,需对比内容相似度(使用TF-IDF工具量化)
- 「软404」需检查页面实际内容是否达到Google定义的阈值(约200词实质性内容)
执行发布前技术检查
第一步:确认页面发现状态
- 服务器日志检查
- 记录字段:最近90天内的Googlebot访问记录、HTTP状态码、抓取频次
- 判断标准:若存在200状态码抓取记录则进入下一步,否则检查robots.txt和内部链接
- 例外情况:动态参数URL需检查参数处理设置
- Search Console验证
- 记录字段:URL检查工具中的"已发现""已抓取"状态、索引覆盖报告中的排除原因
- 验收方式:对比日志抓取时间与Search Console最后抓取日期差异≤7天
第二步:诊断未收录原因
- 技术阻止检查
- 必查项:
- robots.txt指令(使用Search Console测试工具)
- noindex元标签/X-Robots-Tag
- canonical标签一致性(需对比sitemap与页面实际标签)
- 核验项:hreflang链轮错误可能导致区域性不收录
- 内容质量评估
- 依据G1证据:检查正文是否包含以下特征
- 可见文字≥500字(不含导航/页脚)
- 包含至少1个原创数据点或分析结论
- 满足搜索意图(对比排名前3页结果共性)
- 软404判断:页面主体区域无实质性内容且HTTP返回200状态码
服务器与robots文件检查
首先,确保服务器响应正常,使用工具如curl或浏览器开发者工具检查HTTP状态码,应为200。接着,检查robots.txt文件,确认没有错误地阻止了Googlebot的访问。
Canonical标签与内容质量
检查页面是否使用了正确的canonical标签,避免重复内容问题。评估内容质量,确保内容具有原创性和深度,符合Google的内容质量标准。
内部链接与结构化数据
确保页面有足够的内部链接支持,便于Googlebot发现和抓取。同时,验证结构化数据的正确性,确保与页面内容一致。
记录与验收
完成上述检查后,记录每一步的结果,包括HTTP状态码、robots.txt内容、canonical标签、内容质量评估、内部链接和结构化数据。根据记录结果,决定是否需要进一步优化或调整。
收录诊断流程
1. 服务器与抓取状态检查
- 记录字段:服务器响应状态码、抓取日志中的URL、抓取频率
- 判断标准:服务器应返回200状态码,抓取日志中应包含目标URL
- 例外:服务器维护或临时故障可能导致抓取失败
- 验收方式:通过Google Search Console的URL检查工具验证抓取状态
2. Robots.txt与Canonical标签检查
- 记录字段:robots.txt文件内容、Canonical标签设置
- 判断标准:robots.txt不应阻止目标URL,Canonical标签应指向正确的URL
- 例外:某些情况下,Canonical标签可能被错误设置
- 验收方式:使用robots.txt测试工具和Canonical标签检查工具进行验证
3. 内容与内链质量检查
- 记录字段:页面内容长度、内链数量、内链相关性
- 判断标准:页面内容应具有原创性和深度,内链应相关且自然
- 例外:某些页面可能因内容重复或内链不足而不被收录
- 验收方式:通过内容分析工具和内链分析工具进行评估
4. 失败诊断与回滚
- 记录字段:诊断结果、回滚步骤、重新验证时间
- 判断标准:诊断应明确失败原因,回滚步骤应具体且可执行
- 例外:某些问题可能需要多次验证才能解决
- 验收方式:通过重新提交URL并监控收录状态进行验证
角色分工与流程交接
业务责任人(通常为数字营销负责人)
- 输入:提供目标URL清单、预期收录时效、商业优先级标注
- 输出:签署最终验收报告,决策是否升级技术修复
- 交接字段:
business_impact(高/中/低)expected_index_ratio(预期收录比例)deadline(截止日期)
内容责任人(编辑或SEO专员)
- 输入:提交内容更新日志、规范自查报告
- 输出:标注内容质量问题类型(重复/低质/过期)
- 判断标准:
- 原创性(对比SimilarWeb TOP20竞品内容)
- 深度(是否覆盖用户搜索意图的完整决策路径)
- 更新频率(超过6个月未更新需标记)
技术责任人(开发或运维工程师)
- 输入:服务器日志、爬虫模拟测试结果
- 输出:技术诊断报告(HTTP状态码、robots拦截、canonical设置)
- 关键核验项:
last_crawl_timestamp(最后抓取时间)blocked_by_robots(true/false)canonical_match(是否指向自身)
质量审核人(独立QA角色)
- 输入:验收各环节输出物
- 输出:整体风险评估报告
- 升级条件:
- 重复技术问题连续3次迭代未修复
流程记录与验收
采用以下矩阵记录全流程状态,每周同步至共享看板:
URL:业务优先级;发现状态;抓取状态;收录状态;主要障碍;负责人;最后更新
[示例]:高;已发现;已抓取;未收录;内容重复;内容组;2024-03-20
验收标准:
- 技术问题:确保Search Console的"覆盖率报告"中无新增错误
- 内容问题:未被第三方工具(如Ahrefs)标记为重复或低质
- 流程时效:从问题发现到分配负责人不超过2个工作日
诊断流程与决策矩阵
第一步:确认页面发现状态
- 服务器日志核验
- 记录字段:Googlebot IP段访问记录、HTTP状态码、抓取频次
- 判断标准:过去30天内无任何Googlebot访问记录即为未发现
- 例外:动态URL需检查参数处理规则
- URL提交工具反馈
- 记录字段:Search Console「URL检查」中的「已提交」与「已编入索引」状态
- 判断标准:提交72小时后仍显示「未找到」需检查robots.txt
- 验收方式:对比日志中的爬虫User-Agent与Search Console覆盖报告
第二步:分析抓取但未收录原因
- 内容质量评估
- 记录字段:标题重复度、正文信息熵、外部权威链接数
- 判断标准:同时满足以下条件视为低质量:
- 正文可索引文本<300字且无结构化数据
- 无来自行业TOP50站点的外链
- 例外:产品参数页需检查canonical标签
- 技术性阻滞检查
- 记录字段:robots.txt指令、meta robots标签、X-Robots-Tag
- 判断标准:存在以下任意情况即触发返工:
- robots.txt对重要目录整体屏蔽
- 同时存在noindex与规范标签矛盾
- 分页参数被错误拦截
第三步:制定修复决策
- 优先级矩阵
问题类型:观测周期;继续标准;停止标准
服务器未发现:14天;日志出现Googlebot访问;持续无抓取且非robots限制
- 验证方式
- 对于技术问题:通过Search Console「覆盖范围」报告验证修复
- 对于内容问题:使用「与搜索匹配」功能测试摘要吸引力
收录状态诊断执行清单
第一步:确认未被发现
- 服务器日志核验
- 检查过去30天日志中是否有Googlebot IP(需验证IP范围真实性)
- 记录字段:最后抓取日期、HTTP状态码、User-Agent类型、被请求URL路径
- 例外情况:动态生成路径需检查URL参数标准化
- 模拟爬虫请求
- 使用Google Search Console的URL检查工具发起实时请求
- 必须记录:返回的最终状态码、重定向链、渲染后HTML字节数
- 验收标准:与浏览器访问结果进行DOM对比(禁用JS执行差异)
第二步:已发现未收录
- robots.txt审计
- 在根目录下执行
curl -A "Googlebot" https://domain/robots.txt - 关键字段:Disallow规则覆盖率、Sitemap声明状态、爬取延迟设置
- 判断标准:使用GSC的robots测试工具验证规则生效范围
- 规范标签冲突
- 提取页面
<link rel="canonical">与HTTP头信息 - 必须对比:声明规范URL与实际可访问URL的协议、子域名、路径大小写
- 例外处理:多语言/区域版本需检查hreflang集群一致性
第三步:已抓取未索引
- 内容质量评估
- 执行Google Rich Results Test获取结构化数据有效性报告
- 记录字段:核心实体识别率、FAQPage或HowTo标记完整度
- 验收方式:人工复核内容是否满足EEAT原则中的专业性要求
- 内链权重分析
- 使用爬虫工具统计站内指向该页面的链接锚文本分布
- 关键指标:首屏文本占比、导航类链接比例、出站链接相关性
- 重复内容检测
- 提取页面主要文本指纹(去除导航/页脚后的前500词词频)
- 对比维度:与站内TOP10相似页面的余弦相似度
异常类型判断矩阵
类型:服务器日志证据;GSC覆盖率报告;规范链一致性;内容唯一性分数
未知:无抓取记录;未提交;-;-
已发现未抓取:有爬虫访问但403/500;显示已提交;通过;≥60
已抓取未索引:200状态码;显示已抓取;冲突;≤40
软404:200状态码+空内容;显示已抓取;通过;0
重复内容:多次抓取不同URL;显示已索引;未声明;≥90
人工处置:突然停止抓取;人工操作标记;通过;≥70
第一步:确认页面发现状态
- 检查服务器日志
- 记录字段:User-agent包含
Googlebot的200状态码请求 - 判断标准:过去30天内无抓取记录则属于未被发现
- 例外:动态参数URL需检查是否被robots.txt意外屏蔽
- 验收方式:使用Log File Analyzer过滤Googlebot访问记录
- 验证索引API响应
- 记录字段:
urlInspection.indexingState返回值 - 判断标准:
URL_NOT_IN_INDEX且crawledAs为NOT_CRAWLED属未发现 - 例外:已提交sitemap但状态仍为
NOT_CRAWLED需检查sitemap优先级 - 验收方式:Google Search Console的URL检查工具
第二步:诊断抓取障碍
- robots.txt实时测试
- 记录字段:
Allow/Disallow指令对目标路径的最终生效状态 - 判断标准:存在
Disallow且无后续Allow覆盖即阻止抓取 - 例外:动态生成的robots.txt需验证生产环境实际响应
- 验收方式:GSC的robots.txt测试工具+curl实际请求
- 规范标签冲突检测
- 记录字段:
rel=canonical的href值与当前URL差异 - 判断标准:指向其他域名或已noindex的URL会导致不被收录
- 例外:多语言hreflang场景需检查双向标注一致性
- 验收方式:Chrome插件
SEO META in 1 CLICK批量检查
第三步:内容质量核验
- 软404特征检查
- 记录字段:页面实际HTTP状态码与内容长度的关系
- 判断标准:200状态但内容<500字符且无实质信息属高风险
- 例外:API接口文档等特殊内容类型除外
- 验收方式:Screaming Frog批量扫描+人工抽样
- 重复内容指纹比对
- 记录字段:正文部分去掉HTML后的MD5哈希值
- 判断标准:相同哈希值页面超过3个触发重复内容过滤
- 例外:产品规格参数表等合理重复需添加差异化说明
- 验收方式:Python脚本
difflib.SequenceMatcher比对
复发预防措施
- 建立每周抓取异常监控看板,包含:
- Googlebot成功抓取率
- robots.txt变更影响面预估
- 规范链接受损警报
- 内容哈希值重复告警阈值
技术排查框架
第一步:状态确认
使用Google Search Console的[网址检查工具]记录以下字段:
- 覆盖状态:未知/已发现未收录/已抓取未收录
- 最后抓取日期:空值表示未被发现
- 索引状态代码:404/duplicate/soft404/blocked
- 参考页面:显示发现URL的源头(如sitemap/外链)
第二步:服务器层诊断
核验项(需服务器日志验证):
- 抓取请求是否返回200状态码
- robots.txt实时测试工具是否显示意外拦截
- 抓取频次是否被异常限制(对比同类页面)
第三步:内容质量评估
判断标准(需人工验证):
- 原创性:与已收录页面的TF-IDF余弦相似度<0.3
- 深度:解决搜索意图的最小完整信息单元(非字数)
- 时效标记:lastmod与内容更新是否同步
例外情况:
- 动态参数URL需验证canonical标签一致性
- 多语言页面需检查hreflang闭环
验收方式:
- 修复后提交重新索引请求
- 72小时后验证覆盖率报告中的变化
决策证据
当出现以下组合时优先处理:
- 高价值内容 + 技术性拦截(如robots误屏蔽)
- 核心转化路径 + 重复内容问题
- 战略关键词 + 未被发现状态(需强化外链)
状态分类与诊断顺序
首先在Google Search Console的[网址检查工具]输入目标URL,根据返回状态确定问题类型:
- 未知页面(未发现)
- 检查服务器日志确认Googlebot是否访问过
- 验证DNS解析与服务器响应码(需记录200状态比例)
- 排查防火墙/安全策略是否误拦截User-Agent
- 已发现未收录(Discovered – currently not indexed)
- 检查robots.txt阻止规则(需记录Disallow条目数)
- 验证页面加载速度(移动端LCP需≤2.5秒)
- 确认无meta robots noindex标签
- 已抓取未收录(Crawled – currently not indexed)
- 分析内容与已收录页面的相似度(需记录TF-IDF值差异)
- 检查规范标签(canonical)是否指向有效页面
- 评估内容深度(参考G1证据:需有原创分析而非聚合)
可执行诊断矩阵
检查项:记录字段;合格标准;例外处理
robots.txt:Disallow行数;≤5条关键路径;临时屏蔽需标注日期
内链结构:入口页面深度;≤3次点击可达;专题页可放宽至4层
验收方式:
- 对每个未收录URL完成全部6项检查
- 记录Google Search Console状态变化周期(通常7-15天)
- 同一问题重复出现需升级为站点级审计(参考R1证据的多阶段测量法)
延伸阅读
参考资料
评论 (0)
还没有评论,来发表第一条吧。