0

0

使用 xpath 解析 html 的解析器:Jsoupxpath_html/css_WEB-ITnose

php中文网

php中文网

发布时间:2016-06-21 09:04:54

|

1832人浏览过

|

来源于php中文网

原创

JsoupXpath 是一款纯Java开发的使用xpath解析html的解析器,xpath语法分析与执行完全独立,html的DOM树生成借助Jsoup,故命名为JsoupXpath.为了在java里也享受xpath的强大与方便但又苦于找不到一款足够强大的xpath解析器,故开发了JsoupXpath。JsoupXpath的实现逻辑清晰,扩展方便,支持几乎全部常用的xpath语法.
http://www.cnblogs.com/ 为例"//a/@href";"//div[@id='paging_block']/div/a[text()='Next >']/@href";"//div[@id='paging_block']/div/a[text()*='Next']/@href";"//h1/text()";"//h1/allText()";"//h1//text()";"//div/a";"//div[@id='post_list']/div[position()<3]/div/h3/allText()";"//div[@id='post_list']/div[first()]/div/h3/allText()";"//div[@id='post_list']/div[1]/div/h3/allText()";"//div[@id='post_list']/div[last()]/div/h3/allText()";//查找评论大于1000的条目(当然只是为了演示复杂xpath了,谓语中可以各种嵌套,这样才能测试的更全面嘛)"//div[@id='post_list']/div[./div/div/span[@class='article_view']/a/num()>1000]/div/h3/allText()";//轴支持"//div[@id='post_list']/div[self::div/div/div/span[@class='article_view']/a/num()>1000]/div/h3/allText()";"//div[@id='post_list']/div[2]/div/p/preceding-sibling::h3/allText()";"//div[@id='post_list']/div[2]/div/p/preceding-sibling::h3/allText()|//div[@id='post_list']/div[1]/div/h3/allText()";

在这里暂不列出框架间的对比了,但我相信,你们用了会发现JsoupXpath就是目前市面上最强大的的Xpath解析器。

快速开始

如果不方便使用maven,可以直接使用lib下的依赖包跑起来试试,如方便可直接使用如下dependency(已经上传至中央maven库,最新版本0.1.1):

   cn.wanghaomiao   JsoupXpath   0.1.1

依赖配置好后,就可以使用如下例子进行体验了!

String xpath="//div[@id='post_list']/div[./div/div/span[@class='article_view']/a/num()>1000]/div/h3/allText()";String doc = "...";JXDocument jxDocument = new JXDocument(doc);List rs = jxDocument.sel(xpath);for (Object o:rs){    if (o instanceof Element){            int index = ((Element) o).siblingIndex();            System.out.println(index);    }    System.out.println(o.toString());}   

其他可以参考 cn.wanghaomiao.example包下的例子

立即学习前端免费学习笔记(深入)”;

语法

支持标准xpath语法(支持谓语嵌套),支持全部常用函数,支持全部常用轴,去掉了一些标准里面华而不实的函数和轴,下面会具体介绍。语法可以参考http://www.w3school.com.cn/xpath/index.asp

关于使用Xpath的一些注意事项

非常不建议直接粘贴Firefox或chrome里生成的Xpath,这些浏览器在渲染页面会根据标准自动补全一些标签,如table标签会自动加上tbody标签,这样生成的Xpath路径显然不是最通用的,所以很可能就取不到值。所以,要使用Xpath并感受Xpath的强大以及他所带来便捷与优雅最好就是学习下Xpath的标准语法,这样应对各种问题才能游刃有余,享受Xpath的真正威力!

函数

  • text() 提取节点的自有文本

  • node() 提取所有节点

  • position() 返回当前节点所处在同胞中的位置

  • last() 返回同级节点中的最后那个节点

  • first() 返回同级节点中的第一个节点

解析器扩展函数

  • allText()提取节点下全部文本,取代类似 //div/h3//text()这种递归取文本用法

  • html()获取全部节点的内部的html

  • outerHtml()获取全部节点的 包含节点本身在内的全部html

  • num()抽取节点自有文本中全部数字,如果知道节点的自有文本(即非子代节点所包含的文本)中只存在一个数字,如阅读数,评论数,价格等那么直接可以直接提取此数字出来。如果有多个数字将提取第一个匹配的连续数字。

其他说明

  • contains(arga,argb)这个函数暂时不支持,因为JsoupXpath拥有强大的运算符支持,完全可以取代它!如,可以用*=取代contains() 例://div[text()*='next']

  • self 节点自身

  • parent 父节点

  • child 直接子节点

  • ancestor 全部祖先节点 父亲,爷爷 , 爷爷的父亲...

  • ancestor-or-self全部祖先节点和自身节点

    UP简历
    UP简历

    基于AI技术的免费在线简历制作工具

    下载
  • descendant 全部子代节点 儿子,孙子,孙子的儿子...

  • descendant-or-self 全部子代节点和自身

  • preceding-sibling 节点前面的全部同胞节点

  • following-sibling 节点后面的全部同胞节点

轴实用扩展

  • preceding-sibling-one 前一个同胞节点(扩展)

  • following-sibling-one 返回下一个同胞节点(扩展) 语法

  • sibling 全部同胞(扩展)

操作符

这些操作符可谓足够强大,满足几乎你所有的需求。

  • 返回两个节点集的并集

  • a+b 加 返回数值结果

  • a-b 减 返回数值结果

  • a=b 判断是否相等返回Boolean

  • a!=b 不等于 返回Boolean

  • a>b 大于 返回Boolean

  • a>=b 大于等于 返回Boolean

  • a

  • a

操作符扩展

  • a^=b 字符串a是否以字符串b开头 a startwith b 返回Boolean

  • a*=b a是否包含b, a contains b 返回Boolean

  • a$=b a是否以b结尾 a endwith b 返回Boolean

  • a~=b a的内容是否符合 正则表达式b 返回Boolean

其他说明

基本这些足够了,其他鸡肋的暂时不支持,如有特殊需求请联系我。项目地址:GitHub/Jsoupxpath

项目主页:http://www.open-open.com/lib/view/home/1445699703570

相关文章

HTML速学教程(入门课程)
HTML速学教程(入门课程)

HTML怎么学习?HTML怎么入门?HTML在哪学?HTML怎么学才快?不用担心,这里为大家提供了HTML速学教程(入门课程),有需要的小伙伴保存下载就能学习啦!

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
Java 桌面应用开发(JavaFX 实战)
Java 桌面应用开发(JavaFX 实战)

本专题系统讲解 Java 在桌面应用开发领域的实战应用,重点围绕 JavaFX 框架,涵盖界面布局、控件使用、事件处理、FXML、样式美化(CSS)、多线程与UI响应优化,以及桌面应用的打包与发布。通过完整示例项目,帮助学习者掌握 使用 Java 构建现代化、跨平台桌面应用程序的核心能力。

37

2026.01.14

php与html混编教程大全
php与html混编教程大全

本专题整合了php和html混编相关教程,阅读专题下面的文章了解更多详细内容。

19

2026.01.13

PHP 高性能
PHP 高性能

本专题整合了PHP高性能相关教程大全,阅读专题下面的文章了解更多详细内容。

37

2026.01.13

MySQL数据库报错常见问题及解决方法大全
MySQL数据库报错常见问题及解决方法大全

本专题整合了MySQL数据库报错常见问题及解决方法,阅读专题下面的文章了解更多详细内容。

19

2026.01.13

PHP 文件上传
PHP 文件上传

本专题整合了PHP实现文件上传相关教程,阅读专题下面的文章了解更多详细内容。

16

2026.01.13

PHP缓存策略教程大全
PHP缓存策略教程大全

本专题整合了PHP缓存相关教程,阅读专题下面的文章了解更多详细内容。

6

2026.01.13

jQuery 正则表达式相关教程
jQuery 正则表达式相关教程

本专题整合了jQuery正则表达式相关教程大全,阅读专题下面的文章了解更多详细内容。

3

2026.01.13

交互式图表和动态图表教程汇总
交互式图表和动态图表教程汇总

本专题整合了交互式图表和动态图表的相关内容,阅读专题下面的文章了解更多详细内容。

45

2026.01.13

nginx配置文件详细教程
nginx配置文件详细教程

本专题整合了nginx配置文件相关教程详细汇总,阅读专题下面的文章了解更多详细内容。

9

2026.01.13

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
【web前端】Node.js快速入门
【web前端】Node.js快速入门

共16课时 | 2万人学习

Go语言实战之 GraphQL
Go语言实战之 GraphQL

共10课时 | 0.8万人学习

微信小程序开发之API篇
微信小程序开发之API篇

共15课时 | 1.2万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号