绕过XHR：从JavaScript生成页面中提取嵌入式数据-js教程-PHP中文网

绕过XHR：从JavaScript生成页面中提取嵌入式数据

心靈之曲

发布： 2025-10-26 11:16:34

原创

884人浏览过

绕过XHR：从JavaScript生成页面中提取嵌入式数据

本文探讨了如何在目标网页内容由javascript生成且不涉及额外xhr请求时进行数据提取。核心策略是深入检查页面初始加载的html和javascript源码，识别并解析其中可能嵌入的json或其他结构化数据。通过这种方法，即使传统xpath失效，也能有效获取所需信息，为处理特定类型的动态网页爬取提供了解决方案。

动态内容抓取的挑战与传统方法的局限

在网页数据抓取（Web Scraping）领域，传统的方法通常依赖于解析页面的静态HTML结构，例如使用XPath或CSS选择器来定位和提取数据。然而，随着现代Web技术的发展，越来越多的网站采用JavaScript在客户端动态生成内容。这给传统爬虫带来了挑战：当目标内容由JavaScript生成时，它可能不会出现在初始加载的HTML源码中，导致XPath等工具无法找到。

更进一步的挑战在于，一些网站虽然使用JavaScript生成内容，但并没有通过显式的AJAX（XHR）请求从服务器异步加载数据。这意味着，即使使用浏览器的开发者工具检查网络活动，也可能看不到任何与目标数据相关的XHR请求。在这种情况下，传统的基于XHR监控或Selenium等无头浏览器的方法可能显得过于笨重或效率低下。

识别问题：JavaScript生成但无XHR的场景

以https://www.wowhead.com/today-in-wow为例，我们希望提取特定

容器（例如id包含EU-group-holiday-line的元素）中的内容。如果直接尝试使用XPath（如$xpath->query('//*[contains(@id, "EU-group-holiday-line")]');）来解析页面初始HTML，会发现无法获取到所需数据。同时，通过开发者工具的“Network”面板观察，也未发现有任何与这些动态生成内容直接相关的XHR请求。

这种现象表明，尽管内容是动态生成的，但其所需的数据并非在页面加载后通过额外的网络请求获取，而是很可能已经以某种形式（例如JSON字符串）嵌入在页面初始加载的HTML或内联JavaScript代码中。