0

0

LIKE ‘%keyword%’ 导致全表扫描的全文索引 / ngram 替代方案

冷炫風刃

冷炫風刃

发布时间:2026-01-26 20:29:30

|

260人浏览过

|

来源于php中文网

原创

MySQL中LIKE '%keyword%'必然全表扫描,因B+树索引无法支持左模糊匹配;全文索引对中文效果差,需ngram插件或生成列+函数索引优化。

like \'%keyword%\' 导致全表扫描的全文索引 / ngram 替代方案

MySQL 中 LIKE '%keyword%' 为什么必然走全表扫描

因为 LIKE 左侧带通配符(%)时,B+ 树索引无法利用最左前缀匹配规则——索引是按字典序存储的,而 %keyword% 要求从任意位置开始匹配,数据库只能逐行读取并判断,自然触发全表扫描。

即使字段上有普通 B+ 树索引,WHERE content LIKE '%error%' 也完全用不上。唯一例外是 LIKE 'prefix%' 这种右模糊,才可能走索引。

  • 复合索引更没用:比如 (user_id, content)content 不在最左且带左模糊,整个索引失效
  • 函数索引(如 LOWER(content))同样不解决左模糊问题
  • CHARVARCHAR 行为一致,类型不影响该限制

全文索引(FULLTEXT)在中文场景下的硬伤

MySQL 原生 FULLTEXT 索引依赖空格或标点分词,对连续中文文本基本无效——它会把整段文字当做一个“词”,导致 MATCH(content) AGAINST('日志' IN NATURAL LANGUAGE MODE) 查不到任何结果。

除非你提前用程序把中文切好词、用空格拼接再入库(比如存成 "错误 日志 服务 启动"),否则 FULLTEXT 对中文就是摆设。

  • 5.7+ 支持 ngram 插件,但需显式启用且只支持 IN NATURAL LANGUAGE MODEIN BOOLEAN MODE,不支持 AGAINST(... WITH QUERY EXPANSION)
  • ngram_token_size 默认为 2,意味着“错误日志”会被拆成“错”“错误”“误”“误日”“日”“日志”“志”,粒度粗、噪音大
  • 停用词表对中文影响极大:默认停用词包含“的”“了”“在”等高频字,一旦命中就直接忽略整词匹配

启用 ngram 并正确建全文索引的实操步骤

不是加个插件就能用,必须严格按顺序操作,漏一步都会让查询返回空结果。

先确认插件已加载:SHOW PLUGINS; 查看 ngram 是否为 ACTIVE;若没有,需在配置文件中添加 ft_parser=ngram 并重启 MySQL。

Onu
Onu

将脚本转换为内部工具,不需要前端代码。

下载
  • 建表时指定 parser:CREATE TABLE logs (id INT, content TEXT, FULLTEXT(content) WITH PARSER ngram);
  • 已有表需重建索引:ALTER TABLE logs DROP INDEX ft_content, ADD FULLTEXT(content) WITH PARSER ngram;(不能只 ADD FULLTEXT
  • 查询必须用 AGAINST,且关键词长度 ≥ ngram_token_size(默认 2 字);查单字如 '错' 会失败
  • 布尔模式下支持 +/-,但 + 必须紧贴关键词:AGAINST('+错误 +日志' IN BOOLEAN MODE)

比 ngram 更可控的替代方案:生成列 + 函数索引(MySQL 5.7+)

如果关键词固定、长度有限(比如只查 2–4 字的错误码或状态),用生成列预计算所有子串,再建哈希索引,性能和精度都远超 ngram

例如提取所有长度为 3 的子串:

ALTER TABLE logs
ADD COLUMN content_3grams VARCHAR(1000) 
  GENERATED ALWAYS AS (
    CONCAT(
      IF(CHAR_LENGTH(content) >= 3, SUBSTR(content, 1, 3), ''),
      ' ',
      IF(CHAR_LENGTH(content) >= 3, SUBSTR(content, 2, 3), ''),
      ' ',
      IF(CHAR_LENGTH(content) >= 3, SUBSTR(content, 3, 3), ''),
      -- 继续扩展至你需要的最大偏移...
      ' '
    )
  ) STORED;

然后建索引:CREATE INDEX idx_3grams ON logs (content_3grams);,查时用 WHERE content_3grams LIKE '%err%' ——这时是右模糊,能走索引。

  • 空间换时间:每多一个子串长度,存储就翻倍;建议只覆盖业务真正需要的长度(如 HTTP 状态码只做 3 字,错误码只做 4 字)
  • 更新代价高:每次 UPDATE content 都要重算生成列,不适合高频写入场景
  • 无法支持跨字匹配:比如“服务异常”里查“异常”,若生成列只截 2 字,就漏掉“服务”“务异”“异常”,得靠组合多个长度覆盖

ngram 的 token 边界是按字节切的,遇到 UTF-8 多字节字符(比如 emoji 或某些生僻汉字)容易截断出乱码子串;生成列方案虽然麻烦,但逻辑完全可控,上线前务必用真实语料跑一遍子串覆盖率验证。

相关文章

WPS零基础入门到精通全套教程!
WPS零基础入门到精通全套教程!

全网最新最细最实用WPS零基础入门到精通全套教程!带你真正掌握WPS办公! 内含Excel基础操作、函数设计、数据透视表等

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

热门AI工具

更多
DeepSeek
DeepSeek

幻方量化公司旗下的开源大模型平台

豆包大模型
豆包大模型

字节跳动自主研发的一系列大型语言模型

通义千问
通义千问

阿里巴巴推出的全能AI助手

腾讯元宝
腾讯元宝

腾讯混元平台推出的AI助手

文心一言
文心一言

文心一言是百度开发的AI聊天机器人,通过对话可以生成各种形式的内容。

讯飞写作
讯飞写作

基于讯飞星火大模型的AI写作工具,可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

即梦AI
即梦AI

一站式AI创作平台,免费AI图片和视频生成。

ChatGPT
ChatGPT

最最强大的AI聊天机器人程序,ChatGPT不单是聊天机器人,还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

相关专题

更多
mysql修改数据表名
mysql修改数据表名

MySQL修改数据表:1、首先查看数据库中所有的表,代码为:‘SHOW TABLES;’;2、修改表名,代码为:‘ALTER TABLE 旧表名 RENAME [TO] 新表名;’。php中文网还提供MySQL的相关下载、相关课程等内容,供大家免费下载使用。

667

2023.06.20

MySQL创建存储过程
MySQL创建存储过程

存储程序可以分为存储过程和函数,MySQL中创建存储过程和函数使用的语句分别为CREATE PROCEDURE和CREATE FUNCTION。使用CALL语句调用存储过程智能用输出变量返回值。函数可以从语句外调用(通过引用函数名),也能返回标量值。存储过程也可以调用其他存储过程。php中文网还提供MySQL创建存储过程的相关下载、相关课程等内容,供大家免费下载使用。

247

2023.06.21

mongodb和mysql的区别
mongodb和mysql的区别

mongodb和mysql的区别:1、数据模型;2、查询语言;3、扩展性和性能;4、可靠性。本专题为大家提供mongodb和mysql的区别的相关的文章、下载、课程内容,供大家免费下载体验。

281

2023.07.18

mysql密码忘了怎么查看
mysql密码忘了怎么查看

MySQL是一个关系型数据库管理系统,由瑞典MySQL AB 公司开发,属于 Oracle 旗下产品。MySQL 是最流行的关系型数据库管理系统之一,在 WEB 应用方面,MySQL是最好的 RDBMS 应用软件之一。那么mysql密码忘了怎么办呢?php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

515

2023.07.19

mysql创建数据库
mysql创建数据库

MySQL是一个关系型数据库管理系统,由瑞典MySQL AB 公司开发,属于 Oracle 旗下产品。MySQL 是最流行的关系型数据库管理系统之一,在 WEB 应用方面,MySQL是最好的 RDBMS 应用软件之一。那么mysql怎么创建数据库呢?php中文网给大家带来了相关的教程以及文章,欢迎大家前来阅读学习。

256

2023.07.25

mysql默认事务隔离级别
mysql默认事务隔离级别

MySQL是一种广泛使用的关系型数据库管理系统,它支持事务处理。事务是一组数据库操作,它们作为一个逻辑单元被一起执行。为了保证事务的一致性和隔离性,MySQL提供了不同的事务隔离级别。php中文网给大家带来了相关的教程以及文章欢迎大家前来学习阅读。

386

2023.08.08

sqlserver和mysql区别
sqlserver和mysql区别

SQL Server和MySQL是两种广泛使用的关系型数据库管理系统。它们具有相似的功能和用途,但在某些方面存在一些显著的区别。php中文网给大家带来了相关的教程以及文章,欢迎大家前来学习阅读。

532

2023.08.11

mysql忘记密码
mysql忘记密码

MySQL是一种关系型数据库管理系统,关系数据库将数据保存在不同的表中,而不是将所有数据放在一个大仓库内,这样就增加了速度并提高了灵活性。那么忘记mysql密码我们该怎么解决呢?php中文网给大家带来了相关的教程以及其他关于mysql的文章,欢迎大家前来学习阅读。

600

2023.08.14

拼多多赚钱的5种方法 拼多多赚钱的5种方法
拼多多赚钱的5种方法 拼多多赚钱的5种方法

在拼多多上赚钱主要可以通过无货源模式一件代发、精细化运营特色店铺、参与官方高流量活动、利用拼团机制社交裂变,以及成为多多进宝推广员这5种方法实现。核心策略在于通过低成本、高效率的供应链管理与营销,利用平台社交电商红利实现盈利。

31

2026.01.26

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
MySQL 教程
MySQL 教程

共48课时 | 1.9万人学习

MySQL 初学入门(mosh老师)
MySQL 初学入门(mosh老师)

共3课时 | 0.3万人学习

简单聊聊mysql8与网络通信
简单聊聊mysql8与网络通信

共1课时 | 811人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号