首页 > web前端 > js教程 > 正文

绕过XHR:从JavaScript生成页面中提取嵌入式数据

心靈之曲
发布: 2025-10-26 11:16:34
原创
864人浏览过

绕过XHR:从JavaScript生成页面中提取嵌入式数据

本文探讨了如何在目标网页内容由javascript生成且不涉及额外xhr请求时进行数据提取。核心策略是深入检查页面初始加载的htmljavascript源码,识别并解析其中可能嵌入的json或其他结构化数据。通过这种方法,即使传统xpath失效,也能有效获取所需信息,为处理特定类型的动态网页爬取提供了解决方案。

动态内容抓取的挑战与传统方法的局限

在网页数据抓取(Web Scraping)领域,传统的方法通常依赖于解析页面的静态HTML结构,例如使用XPath或CSS选择器来定位和提取数据。然而,随着现代Web技术的发展,越来越多的网站采用JavaScript在客户端动态生成内容。这给传统爬虫带来了挑战:当目标内容由JavaScript生成时,它可能不会出现在初始加载的HTML源码中,导致XPath等工具无法找到。

更进一步的挑战在于,一些网站虽然使用JavaScript生成内容,但并没有通过显式的AJAX(XHR)请求从服务器异步加载数据。这意味着,即使使用浏览器的开发者工具检查网络活动,也可能看不到任何与目标数据相关的XHR请求。在这种情况下,传统的基于XHR监控或Selenium等无头浏览器的方法可能显得过于笨重或效率低下。

识别问题:JavaScript生成但无XHR的场景

以https://www.wowhead.com/today-in-wow为例,我们希望提取特定<section>容器(例如id包含EU-group-holiday-line的元素)中的内容。如果直接尝试使用XPath(如$xpath->query('//*[contains(@id, "EU-group-holiday-line")]');)来解析页面初始HTML,会发现无法获取到所需数据。同时,通过开发者工具的“Network”面板观察,也未发现有任何与这些动态生成内容直接相关的XHR请求。

这种现象表明,尽管内容是动态生成的,但其所需的数据并非在页面加载后通过额外的网络请求获取,而是很可能已经以某种形式(例如JSON字符串)嵌入在页面初始加载的HTML或内联JavaScript代码中。

AI封面生成器
AI封面生成器

专业的AI封面生成工具,支持小红书、公众号、小说、红包、视频封面等多种类型,一键生成高质量封面图片。

AI封面生成器 108
查看详情 AI封面生成器

立即学习Java免费学习笔记(深入)”;

解决方案:深入分析初始HTML源码

当遇到JavaScript生成内容且无XHR请求的场景时,核心策略是转变思路:不再专注于DOM结构,而是深入挖掘页面加载时获取的原始HTML源码。

核心假设

如果内容是JavaScript生成的,但没有额外的XHR请求,那么支撑这些内容的数据极有可能作为JavaScript变量、内联JSON对象或数组的形式,直接嵌入在页面的<script>标签中,或者作为某个HTML元素的data-*属性值存在于初始加载

以上就是绕过XHR:从JavaScript生成页面中提取嵌入式数据的详细内容,更多请关注php中文网其它相关文章!

最佳 Windows 性能的顶级免费优化软件
最佳 Windows 性能的顶级免费优化软件

每个人都需要一台速度更快、更稳定的 PC。随着时间的推移,垃圾文件、旧注册表数据和不必要的后台进程会占用资源并降低性能。幸运的是,许多工具可以让 Windows 保持平稳运行。

下载
来源:php中文网
本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn
最新问题
开源免费商场系统广告
热门教程
更多>
最新下载
更多>
网站特效
网站源码
网站素材
前端模板
关于我们 免责申明 意见反馈 讲师合作 广告合作 最新更新 English
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送
PHP中文网APP
随时随地碎片化学习

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号