如何在 Pandas 中基于子字符串匹配实现 DataFrame 左连接

霞舞

发布时间：2026-01-12 19:00:17

361人浏览过

来源于php中文网

原创

如何在 Pandas 中基于子字符串匹配实现 DataFrame 左连接

本文介绍一种高效、可靠的方法：通过正则提取子字符串构建临时键，再执行左连接，从而将 name 列（如 "dale"）与包含该名称的 id 字符串（如 "dale-999999"）精准关联。

在实际数据处理中，常遇到「一端为完整标识符、另一端仅为其中一部分」的关联需求——例如 a["Name"] 是人名（"Dale"），而 b["ID"] 是带后缀的复合 ID（"Dale-999999"）。此时无法直接使用等值连接（merge），需借助字符串匹配逻辑构建映射关系。

核心思路是：先从 b["ID"] 中提取出与 a["Name"] 完全一致的子串，生成临时键 _name；再以此键与 a["Name"] 执行左连接（how='left'）。这既满足“每个 b["ID"] 最多匹配一个 a["Name"]”的约束，也支持“一个 a["Name"] 对应多个 b["ID"]”的业务场景（如 "Bill" 匹配 "Bill-000" 和 "Bill-001"）。

具体实现如下：

import pandas as pd

a = pd.DataFrame({"Name": ["Boomhaur", "Dale", "Bill", "Hank"]})
b = pd.DataFrame({"ID": ["Boomhaur-2345", "Dale-999999", "Bill-000", "Bill-001", "Peggy-420"]})

# 构建正则模式：\b(Boomhaur|Dale|Bill|Hank)\b → 确保精确单词匹配，避免 "Bill" 匹配 "Billy"
pat = r'\b(' + '|'.join(a['Name'].str.replace(r'[^\w\s]', r'\\', regex=True)) + r')\b'
b['_name'] = b["ID"].str.extract(pat)

# 执行左连接：以 a["Name"] 为左键，b["_name"] 为右键
result = a.merge(b, how='left', left_on='Name', right_on='_name')

# 清理临时列（可选）
result = result.drop(columns=['_name']).reset_index(drop=True)
print(result)

输出结果为：

百度文心一格

百度推出的AI绘画作图工具

下载

       Name             ID
0  Boomhaur  Boomhaur-2345
1      Dale    Dale-999999
2      Bill       Bill-000
3      Bill       Bill-001
4      Hank            NaN

⚠️ 注意事项：

正则中的 \b（词边界）至关重要，可防止误匹配（如 "Bill" 不会错误匹配 "Billy" 或 "ABill"）；
若 a["Name"] 中含正则元字符（如 +, *, (），务必用 str.replace(..., regex=True) 转义，否则引发 re.error；
str.extract() 返回首个匹配项，符合“每个 ID 至多匹配一个 Name”的前提；
若需保留 b 中未匹配的行，应改用 how='right' 或外连接，但本例明确要求以 a 为主表，故使用 how='left'。

该方法简洁、可读性强，且完全基于 Pandas 原生向量化操作，无需循环或 apply，性能优异，适用于中大型数据集。

PythonFlask系统学习路线第266讲_核心原理与实战案例详解【技巧】

Python FastAPI依赖注入_Python FastAPI依赖注入系统如何简化代码

python如何处理掉12306的验证码

Python爬虫实现APP接口抓取与反调试对抗的关键技术【技巧】

Kivy应用界面不显示？理解并正确使用build()方法返回根部件

相关标签:

app pandas Error 标识符字符串循环 Regex

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：Python机器视觉实战教程_目标识别与图像分析项目下一篇：如何在 Pandas 中按分组标记每个客户首次出现 “Y” 的日期

作者最新文章

历史演义跑团类游戏《捉刀》Steam上线获特别好评

2026-01-11 10:43

如何分析图遍历算法的空间复杂度：以邻接矩阵+BFS路径检测为例

2026-01-11 10:55

赢了才能开电脑，开发者耗时 10 个月自制 UEFI 小游戏合集

2026-01-11 10:55

视频号后台如何设置自动回复

2026-01-11 10:55

如何正确使用 Go 的 encoding/xml 包进行序列化与反序列化

2026-01-11 11:03

汉印错题app怎么打印文档-文档打印步骤

2026-01-11 11:08

全民K歌如何设置出好听音效

2026-01-11 11:08

Laravel 中正确绑定数组参数实现 WHERE IN 查询的完整指南

2026-01-11 11:14

Bootstrap 5 多卡片轮播：实现每页显示 3 张卡片的完整方案

2026-01-11 11:29

如何在 AnyChart 中通过按钮切换多组数据实现极坐标柱状图的动态展示

2026-01-11 11:31

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI大模型

开放平台

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI大模型

通义千问

阿里巴巴推出的全能AI助手

AI大模型

腾讯元宝

腾讯混元平台推出的AI助手

文档处理

Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI大模型

中文写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

中文写作

写作工具

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接

图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI大模型

中文写作

智谱清言 - 免费全能的AI助手

AI大模型

PDF 文档

相关专题

Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧，涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估，以及基于实际业务场景的时间序列项目实操，帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

scripterror怎么解决

scripterror的解决办法有检查语法、文件路径、检查网络连接、浏览器兼容性、使用try-catch语句、使用开发者工具进行调试、更新浏览器和JavaScript库或寻求专业帮助等。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

187

2023.10.18

500error怎么解决

500error的解决办法有检查服务器日志、检查代码、检查服务器配置、更新软件版本、重新启动服务、调试代码和寻求帮助等。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

271

2023.10.25

mysql标识符无效错误怎么解决

mysql标识符无效错误的解决办法：1、检查标识符是否被其他表或数据库使用；2、检查标识符是否包含特殊字符；3、使用引号包裹标识符；4、使用反引号包裹标识符；5、检查MySQL的配置文件等等。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

179

2023.12.04

Python标识符有哪些

Python标识符有变量标识符、函数标识符、类标识符、模块标识符、下划线开头的标识符、双下划线开头、双下划线结尾的标识符、整型标识符、浮点型标识符等等。本专题为大家提供相关的文章、下载、课程内容，供大家免费下载体验。

277

2024.02.23

java标识符合集

本专题整合了java标识符相关内容，想了解更多详细内容，请阅读下面的文章。

252

2025.06.11

c++标识符介绍

本专题整合了c++标识符相关内容，阅读专题下面的文章了解更多详细内容。

121

2025.08.07

js 字符串转数组

js字符串转数组的方法：1、使用“split()”方法；2、使用“Array.from()”方法；3、使用for循环遍历；4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容，供大家免费下载体验。

254

2023.08.03

Java 项目构建与依赖管理（Maven / Gradle）

本专题系统讲解 Java 项目构建与依赖管理的完整体系，重点覆盖 Maven 与 Gradle 的核心概念、项目生命周期、依赖冲突解决、多模块项目管理、构建加速与版本发布规范。通过真实项目结构示例，帮助学习者掌握从零搭建、维护到发布 Java 工程的标准化流程，提升在实际团队开发中的工程能力与协作效率。

2026.01.12

热门下载

网站特效

网站源码

网站素材

前端模板