百度收录查询工具给出的“已收录”只说明URL进入过索引,不能证明动态页面渲染后的正文、价格、库存等可见内容也被抓取和采用。确认动态页面可见内容,应当以百度抓取到的HTML与渲染结果为判断对象,而不是以浏览器里看到的画面为准。时间和人手有限时,优先检查返回给爬虫的原始HTML中是否已有目标文本,再用抓取诊断或抓取异常记录核对渲染后的内容。
要查什么:动态页面首屏最关键的一段文字,例如商品名、价格、正文首句,是否出现在服务器直接返回的HTML源码里。
怎么查:用浏览器的“查看网页源代码”,或用命令行抓取:
curl -A "Baiduspider" https://example.com/page
把返回内容保存后搜索目标文本。如果源码中没有、只有JavaScript执行后才出现,说明该内容依赖渲染。
结果说明什么:源码中已有目标文本,渲染风险较低;源码中没有而页面可见,说明必须确认百度渲染后能否拿到这段内容。这是最省人力的第一道筛选,能快速把问题页面缩小到少数几个。
要查什么:百度抓取该动态页面后,渲染结果里是否包含目标文本,以及是否出现脚本报错、接口被拦截、内容为空。
怎么查:在百度搜索资源平台使用抓取诊断或抓取异常相关功能,查看抓取返回的HTML与渲染信息;同时检查页面是否依赖登录、Cookie、地理位置或用户交互才显示内容。若接口需要特定请求头或令牌,爬虫访问时可能拿不到数据。
结果说明什么:渲染结果含目标文本,说明可见内容可被采用;渲染结果为空或只有骨架,说明需要改为服务端输出关键内容,或为爬虫提供可访问的数据接口。注意,robots.txt 禁止抓取某个JS或接口,不等于该内容会被可靠地从索引中移除;它只限制抓取,不保证移除已收录内容。
要查什么:动态URL是否被提交、是否被百度收录查询工具显示为已收录,以及同一内容是否存在多个参数版本。
怎么查:把动态页面的规范URL放入站点地图,在百度搜索资源平台提交;再用百度收录查询工具或站内检索确认URL状态。对带参数、分页、筛选条件的URL,检查是否通过 canonical 或参数处理指向唯一版本。
结果说明什么:站点地图不保证收录,它只帮助发现URL;已收录也不等于渲染后的可见内容正确。若多个参数版本都被收录,可能分散权重并让百度选错版本,此时应优先统一规范URL,而不是反复提交。
如果只能先做一件事,就做第一项:用爬虫UA抓取原始HTML并搜索目标文本。它成本最低,却能直接区分“内容已在源码中”和“内容依赖渲染”两种情况,决定后续是处理抓取、渲染还是规范URL。完成这一步后,再针对源码中没有目标文本的页面逐项检查渲染与拦截配置。