0

0

使用正则表达式实现WhatsApp风格的文本格式化转换

DDD

DDD

发布时间:2025-11-21 19:24:17

|

737人浏览过

|

来源于php中文网

原创

使用正则表达式实现WhatsApp风格的文本格式化转换

本文详细探讨了如何利用正则表达式将类似whatsapp的特殊符号(如`*`、`_`、`~`)转换为对应的html标签(``、``、``)。教程不仅涵盖了基本的转换逻辑,还深入讲解了如何处理whatsapp特有的复杂规则,例如字符前缀限制、符号重复次数限制以及组合格式化,并提供了具体的代码示例和注意事项,以实现精确且健壮的文本格式转换。

引言:文本格式化与正则表达式

在现代即时通讯应用和内容发布平台中,用户常常通过简单的标记符号(如星号、下划线、波浪线)来对文本进行加粗、斜体或删除线处理。为了在前端正确渲染这些格式,我们需要将这些标记转换为标准的HTML标签。正则表达式提供了一种强大而灵活的方式来解析和转换这类文本格式。然而,不同的平台(如WhatsApp、Stack Overflow)对这些标记的解析规则可能存在细微差别,例如对标记前导字符的限制或标记符号重复次数的限制。本教程将深入探讨如何使用正则表达式处理这些复杂的WhatsApp风格格式化规则。

基本文本格式化规则与挑战

WhatsApp等应用通常使用以下符号来表示文本格式:

  • *文本*:加粗 (转换为 文本)
  • _文本_:斜体 (转换为 文本)
  • ~文本~:删除线 (转换为 文本) 同时,这些格式可以组合使用,例如 ~_*文本*_~ 表示加粗、斜体和删除线。

用户尝试的初步正则表达式

一个基础的正则表达式可以相对简单地实现上述转换,例如:

text
    .replace(/(?:\*)(?:(?!\s))((?:(?!\*|\n).)+)(?:\*)/g, '$1')
    .replace(/(?:_)(?:(?!\s))((?:(?!\n|_).)+)(?:_)/g, '$1')
    .replace(/(?:~)(?:(?!\s))((?:(?!\n|~).)+)(?:~)/g, '$1');

这段代码利用了非捕获组 (?:...) 和负向先行断言 (?!\s) 来确保开放标记后不能立即跟空格,同时捕获中间的文本内容。然而,这种方法在面对WhatsApp特有的复杂规则时会显得力不从心。

WhatsApp的特殊规则

WhatsApp的文本格式化规则比简单的标记匹配更为严格,主要体现在以下几个方面:

  1. 前导字符限制

    • 某些字符(如逗号 ,、冒号 :、分号 ;、空格 `、下划线_、波浪线~、点.、换行符\n、星号*`)允许紧随其后的标记生效。
    • 但另一些字符(如 @)则会阻止标记生效。例如:
      • *this text is bold* -> this text is bold
      • ,*this text is bold* -> ,this text is bold
      • @*this text is not bold* -> @*this text is not bold* (保持不变)
  2. 符号重复限制

    • WhatsApp通常只识别单个或特定数量的标记符号。例如,使用两个星号 ** 可以实现加粗(虽然这与Markdown的语义不同,但这里是WhatsApp的特定规则),但使用三个或更多星号 *** 则可能导致格式化失败。
      • **this text is bold** -> *this text is bold* (注意,这里可能保留了一个星号,这取决于具体实现,但核心是实现了加粗)
      • ***this text is not bold** -> ***this text is not bold** (保持不变)
  3. 组合格式化

    • 多种格式可以嵌套或组合使用,例如 ~_*this text is bold, italic and strike-through*_~。这要求正则表达式能够正确识别并处理这些嵌套结构。

利用高级正则表达式实现WhatsApp规则

为了应对WhatsApp的这些复杂规则,我们需要引入更高级的正则表达式特性,特别是负向先行断言 (Negative Lookahead)负向后行断言 (Negative Lookbehind)

负向先行断言 (?!\s)

这个断言在前面的初步尝试中已经出现。它确保匹配的标记符号后面不能立即跟随一个空格。这对于防止 * text * 这样的格式被错误识别为加粗非常重要,因为WhatsApp通常要求标记符号紧贴着文本。

负向后行断言 (?

这是处理前导字符限制的关键。负向后行断言 (?

Shakespeare
Shakespeare

一款人工智能文案软件,能够创建几乎任何类型的文案。

下载

例如,(?

综合解决方案示例

结合负向先行断言和负向后行断言,我们可以构建一个更符合WhatsApp规则的正则表达式。以下是一个示例,它尝试处理前导字符限制和开闭标记后不能跟空格的规则:

var string = `
These should pass
  *this text is bold*, 
  _this text is italic_, 
  ~this text is strikethrough~. 
  ~_*this text is bold, italic and strike-through*_~

And, these should fail
  _ example_
  {*example*}
  example*
  example*
  @*this text is not bold*
  ***this text is not bold**
`;

// 优先处理最内层或最复杂的组合格式
// 注意:处理组合格式通常需要多次替换,或者更复杂的单一正则。
// 这里我们按顺序处理,假设嵌套是外层包含内层。
// 例如,先处理加粗,然后斜体,然后删除线。
// 对于 ~_*text*_~ 这样的,顺序很重要。
// 我们可以从内到外,或者从外到内,取决于具体需求。
// 这里的方案是依次替换,这意味着如果一个文本已经被加粗,它里面的斜体或删除线会继续被处理。

// 1. 处理加粗
// (??/.,;:'"|`~])
// \*(?!\s) 确保 * 后面不是空格
// (.+?) 捕获中间的文本,非贪婪匹配
// \* 匹配结束的 *
string = string.replace(/(?$1');

// 2. 处理斜体
// 规则类似加粗
string = string.replace(/(?$1');

// 3. 处理删除线
// 规则类似加粗
string = string.replace(/(?$1');

console.log(string);

代码解释:

  • string.replace(...): 这是一个链式替换操作,意味着每种格式(加粗、斜体、删除线)都会独立地被处理。这种顺序处理对于处理组合格式非常有效,因为一个已经被转换的HTML标签内部的文本仍然可以被后续的正则表达式匹配和转换。
  • (?: 这是一个负向后行断言。它确保在匹配开放标记符号(*、_、~)之前,不会出现字符集合 {、[、?、} 中的任何一个。这解决了部分前导字符限制问题。如果WhatsApp有更多限制字符(如 @),可以将它们添加到这个字符集中。
  • \* / _ / ~: 匹配字面意义上的星号、下划线或波浪线,作为开放标记。
  • (?!\s): 这是一个负向先行断言。它确保开放标记符号后面不能立即跟着一个空格。这是WhatsApp等应用中常见的规则,防止 * hello * 被错误识别。
  • (.+?): 这是一个捕获组,使用非贪婪匹配 +? 来捕获开放标记和关闭标记之间的所有字符。$1 在替换字符串中引用这个捕获到的内容。
  • /g: 全局标志,确保替换所有匹配项,而不仅仅是第一个。

运行上述代码,你会发现它能够成功转换 *this text is bold* 等,并保持 {*example*} 和 @*this text is not bold* 不变(因为 * 前面有 { 或 @,或者 * 后面有空格)。

注意事项与局限性

尽管正则表达式在处理这类问题上非常强大,但仍有一些注意事项和局限性:

  1. 嵌套与复杂场景

    • 上述顺序替换方法对于简单的嵌套(如 text)是有效的。但对于更复杂的、非标准嵌套或交错的标记(例如 *bold _italic* text_,这在Markdown中是非法的),简单的正则表达式可能无法正确解析,甚至可能产生意想不到的结果。
    • 当文本内容本身包含标记符号时(例如 this text has an *asterisk* inside),如果处理不当,可能会导致解析错误。更健壮的解决方案可能需要转义机制或更复杂的解析器。
  2. 处理顺序

    • 在有多种格式且可能嵌套的情况下,替换的顺序至关重要。例如,如果 ~_*text*_~ 存在,先处理最外层的删除线,再处理加粗,最后斜体,通常能得到正确的结果。反之,如果先处理加粗,可能导致删除线无法正确匹配。上述代码示例采取了从粗到细的替换策略,对于大多数WhatsApp风格的组合格式是有效的。
  3. 性能考量

    • 对于非常长的字符串和大量的替换操作,正则表达式的性能可能成为一个考虑因素。特别是当正则表达式中包含复杂的断言(如负向后行断言)时,可能会增加处理时间。
  4. 规则扩展性

    • 如果WhatsApp引入了新的格式规则或修改了现有规则,你需要相应地修改或扩展正则表达式。对于非常动态和复杂的格式化需求,一个完整的解析器(如基于状态机或AST)可能比纯正则表达式更为灵活和可维护。

总结

通过巧妙地运用正则表达式,特别是负向先行断言和负向后行断言,我们可以有效地将WhatsApp风格的文本标记转换为HTML格式,同时遵守其特有的复杂规则,如前导字符限制和符号后的空格限制。虽然正则表达式在许多场景下都表现出色,但对于极其复杂或需要高度健壮性的文本解析任务,可能需要结合其他解析技术或专门的Markdown解析库来达到最佳效果。理解这些高级正则表达式的用法,将大大提升你在文本处理方面的能力。

相关专题

更多
js正则表达式
js正则表达式

php中文网为大家提供各种js正则表达式语法大全以及各种js正则表达式使用的方法,还有更多js正则表达式的相关文章、相关下载、相关课程,供大家免费下载体验。

510

2023.06.20

正则表达式不包含
正则表达式不包含

正则表达式,又称规则表达式,,是一种文本模式,包括普通字符和特殊字符,是计算机科学的一个概念。正则表达式使用单个字符串来描述、匹配一系列匹配某个句法规则的字符串,通常被用来检索、替换那些符合某个模式的文本。php中文网给大家带来了有关正则表达式的相关教程以及文章,希望对大家能有所帮助。

247

2023.07.05

java正则表达式语法
java正则表达式语法

java正则表达式语法是一种模式匹配工具,它非常有用,可以在处理文本和字符串时快速地查找、替换、验证和提取特定的模式和数据。本专题提供java正则表达式语法的相关文章、下载和专题,供大家免费下载体验。

738

2023.07.05

java正则表达式匹配字符串
java正则表达式匹配字符串

在Java中,我们可以使用正则表达式来匹配字符串。本专题为大家带来java正则表达式匹配字符串的相关内容,帮助大家解决问题。

211

2023.08.11

正则表达式空格
正则表达式空格

正则表达式空格可以用“s”来表示,它是一个特殊的元字符,用于匹配任意空白字符,包括空格、制表符、换行符等。本专题为大家提供正则表达式相关的文章、下载、课程内容,供大家免费下载体验。

350

2023.08.31

Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

293

2023.11.13

正则表达式空格如何表示
正则表达式空格如何表示

正则表达式空格可以用“s”来表示,它是一个特殊的元字符,用于匹配任意空白字符,包括空格、制表符、换行符等。想了解更多正则表达式空格怎么表示的内容,可以访问下面的文章。

232

2023.11.17

正则表达式中如何匹配数字
正则表达式中如何匹配数字

正则表达式中可以通过匹配单个数字、匹配多个数字、匹配固定长度的数字、匹配整数和小数、匹配负数和匹配科学计数法表示的数字的方法匹配数字。更多关于正则表达式的相关知识详情请看本专题下面的文章。php中文网欢迎大家前来学习。

528

2023.12.06

Golang gRPC 服务开发与Protobuf实战
Golang gRPC 服务开发与Protobuf实战

本专题系统讲解 Golang 在 gRPC 服务开发中的完整实践,涵盖 Protobuf 定义与代码生成、gRPC 服务端与客户端实现、流式 RPC(Unary/Server/Client/Bidirectional)、错误处理、拦截器、中间件以及与 HTTP/REST 的对接方案。通过实际案例,帮助学习者掌握 使用 Go 构建高性能、强类型、可扩展的 RPC 服务体系,适用于微服务与内部系统通信场景。

4

2026.01.15

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Bootstrap 5教程
Bootstrap 5教程

共46课时 | 2.9万人学习

AngularJS教程
AngularJS教程

共24课时 | 2.6万人学习

CSS教程
CSS教程

共754课时 | 19.1万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号