0

0

re如何获取html_通过正则表达式(RegExp)提取HTML内容方法

星夢妙者

星夢妙者

发布时间:2025-11-12 16:15:03

|

260人浏览过

|

来源于php中文网

原创

可用正则提取HTML标签文本,如匹配 内容 中的内容;2. 可提取标签属性值,如 img 的 src;3. 可提取超链接的URL和显示文本;4. 但正则不适用于嵌套或格式错误的HTML,建议仅在简单场景使用,复杂结构应使用DOM解析器。

re如何获取html_通过正则表达式(regexp)提取html内容方法

在处理网页内容或字符串时,经常需要从HTML中提取特定信息。虽然不推荐用正则表达式解析完整的HTML结构(应使用DOM解析器),但在简单场景下,正则表达式可以快速提取所需内容。

1. 提取HTML标签中的文本内容

如果你想从某个HTML标签中提取文本,比如获取

Hello

中的 "Hello",可以使用如下正则:

/

(.*?)/g

说明:

  • (.*?) 是非贪婪匹配,捕获标签内的内容
  • g 标志表示全局匹配,找到所有匹配项
  • 注意斜杠 / 需要转义为 \/

示例代码:

立即学习前端免费学习笔记(深入)”;

const html = '

第一段

第二段

'; const matches = [...html.matchAll(/

(.*?)/g)]; matches.forEach(match => console.log(match[1])); // 输出:第一段,第二段

2. 提取指定标签的属性值

例如提取所有图片的 src 属性:

Booth.ai
Booth.ai

高质量AI产品展示效果图生成

下载
/re如何获取html_通过正则表达式(RegExp)提取HTML内容方法]+src=["']([^"']+)["'][^>]*>/g

说明:

  • [^>]+ 匹配标签内任意非“>”字符
  • ["']([^"']+) 匹配单引号或双引号内的src值
  • 适用于格式较规范的HTML片段

示例:

const html = '图1re如何获取html_通过正则表达式(RegExp)提取HTML内容方法'; const srcs = [...html.matchAll(/re如何获取html_通过正则表达式(RegExp)提取HTML内容方法]+src=["']([^"']+)["'][^>]*>/g)]; srcs.forEach(match => console.log(match[1])); // pic1.jpg, pic2.png

3. 提取超链接中的URL和链接文本

提取 ... 的链接地址和显示文字:

/]+href=["']([^"']+)["'][^>]*>(.*?)/g

示例:

const html = `访问示例网站`; const links = [...html.matchAll(/]+href=["']([^"']+)["'][^>]*>(.*?)/g)]; links.forEach(match => { console.log('URL:', match[1]); // https://example.com console.log('文本:', match[2]); // 访问示例网站 });

4. 注意事项与局限性

正则提取HTML有明显限制:

  • 无法处理嵌套标签(如 div 套 div)
  • 对格式错误的HTML容易出错
  • 不支持完整HTML语法(注释、自闭合标签等)
  • 性能不如原生DOM解析

建议: 在Node.js浏览器环境中,优先使用DOMParser或jsdom等工具。仅在轻量、可控的HTML片段中使用正则。

基本上就这些,正则适合简单提取,复杂结构还是交给解析器更稳妥。

相关专题

更多
js正则表达式
js正则表达式

php中文网为大家提供各种js正则表达式语法大全以及各种js正则表达式使用的方法,还有更多js正则表达式的相关文章、相关下载、相关课程,供大家免费下载体验。

506

2023.06.20

正则表达式不包含
正则表达式不包含

正则表达式,又称规则表达式,,是一种文本模式,包括普通字符和特殊字符,是计算机科学的一个概念。正则表达式使用单个字符串来描述、匹配一系列匹配某个句法规则的字符串,通常被用来检索、替换那些符合某个模式的文本。php中文网给大家带来了有关正则表达式的相关教程以及文章,希望对大家能有所帮助。

245

2023.07.05

java正则表达式语法
java正则表达式语法

java正则表达式语法是一种模式匹配工具,它非常有用,可以在处理文本和字符串时快速地查找、替换、验证和提取特定的模式和数据。本专题提供java正则表达式语法的相关文章、下载和专题,供大家免费下载体验。

722

2023.07.05

java正则表达式匹配字符串
java正则表达式匹配字符串

在Java中,我们可以使用正则表达式来匹配字符串。本专题为大家带来java正则表达式匹配字符串的相关内容,帮助大家解决问题。

209

2023.08.11

正则表达式空格
正则表达式空格

正则表达式空格可以用“s”来表示,它是一个特殊的元字符,用于匹配任意空白字符,包括空格、制表符、换行符等。本专题为大家提供正则表达式相关的文章、下载、课程内容,供大家免费下载体验。

343

2023.08.31

Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

293

2023.11.13

正则表达式空格如何表示
正则表达式空格如何表示

正则表达式空格可以用“s”来表示,它是一个特殊的元字符,用于匹配任意空白字符,包括空格、制表符、换行符等。想了解更多正则表达式空格怎么表示的内容,可以访问下面的文章。

229

2023.11.17

正则表达式中如何匹配数字
正则表达式中如何匹配数字

正则表达式中可以通过匹配单个数字、匹配多个数字、匹配固定长度的数字、匹配整数和小数、匹配负数和匹配科学计数法表示的数字的方法匹配数字。更多关于正则表达式的相关知识详情请看本专题下面的文章。php中文网欢迎大家前来学习。

526

2023.12.06

俄罗斯搜索引擎Yandex最新官方入口网址
俄罗斯搜索引擎Yandex最新官方入口网址

Yandex官方入口网址是https://yandex.com;用户可通过网页端直连或移动端浏览器直接访问,无需登录即可使用搜索、图片、新闻、地图等全部基础功能,并支持多语种检索与静态资源精准筛选。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

1

2025.12.29

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Node.js 教程
Node.js 教程

共57课时 | 7.5万人学习

Vue 教程
Vue 教程

共42课时 | 5.6万人学习

AngularJS教程
AngularJS教程

共24课时 | 2.1万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号