0

0

Pandas中从混合字符串列提取数字并进行分组聚合的教程

花韻仙語

花韻仙語

发布时间:2025-09-13 13:17:00

|

429人浏览过

|

来源于php中文网

原创

Pandas中从混合字符串列提取数字并进行分组聚合的教程

本教程将详细介绍如何在Pandas数据帧中处理包含混合文本和数字的列。我们将学习如何利用str.extract结合正则表达式高效地从字符串中提取数值,并通过groupby方法对提取出的数据进行分组求和。文章还将涵盖条件性聚合的实现,帮助读者掌握清洗和分析复杂数据列的关键技巧。

在数据分析实践中,我们经常会遇到pandas数据帧中的某一列包含混合了文本和数字的数据,且格式不统一。例如,一个“销售额”列可能包含“1 table”、“3chairs”、“8 cushions”等多种表达方式。直接对这样的列进行数值计算(如求和)是不可行的。本教程旨在解决这一常见问题,展示如何从这些复杂字符串中准确提取数字,并根据其他列进行分组聚合。

准备数据

首先,我们创建一个示例Pandas DataFrame来模拟上述场景:

import pandas as pd
import io

data = """Category    Sales       Paid
Table       1 table     Yes
Chair       3chairs     Yes
Cushion     8 cushions  Yes
Table       3Tables     Yes
Chair       12 Chairs   No
Mats        12Mats      Yes
"""
df = pd.read_csv(io.StringIO(data), sep='\s+')
print("原始数据帧:")
print(df)

输出的原始数据帧如下:

原始数据帧:
  Category       Sales Paid
0    Table     1 table  Yes
1    Chair     3chairs  Yes
2  Cushion  8 cushions  Yes
3    Table     3Tables  Yes
4    Chair    12 Chairs   No
5     Mats       12Mats  Yes

可以看到,Sales列中的数字和文本混杂,且格式不一致。我们的目标是从Sales列中提取纯数字,然后按Category列进行分组求和。

核心方法:使用 str.extract 提取数字

Pandas Series对象提供了一系列强大的字符串方法,其中str.extract()是处理复杂字符串提取的利器。它结合正则表达式,能够从字符串中捕获特定模式的子串。

要从Sales列中提取开头的数字,我们可以使用正则表达式^(\d+):

  • ^:匹配字符串的开头。
  • \d+:匹配一个或多个数字(0-9)。
  • ():创建一个捕获组,str.extract将返回这个捕获组的内容。

str.extract(pattern, expand=False) 会将匹配到的内容作为Series返回,如果设置为expand=True(默认值),则会返回一个DataFrame。在这里,我们只需要一个Series,所以使用expand=False。

# 提取Sales列中的数字
extracted_numbers = df['Sales'].str.extract('^(\d+)', expand=False)
print("\n提取出的数字(字符串形式):")
print(extracted_numbers)

输出结果:

Giiso写作机器人
Giiso写作机器人

Giiso写作机器人,让写作更简单

下载
提取出的数字(字符串形式):
0     1
1     3
2     8
3     3
4    12
5    12
Name: Sales, dtype: object

此时,提取出的数字仍然是字符串类型(dtype: object)。为了进行数值计算,我们需要将其转换为整数类型。

# 将提取出的数字转换为整数
sales_numbers = extracted_numbers.astype(int)
print("\n转换为整数类型后的销售数字:")
print(sales_numbers)

输出结果:

转换为整数类型后的销售数字:
0     1
1     3
2     8
3     3
4    12
5    12
Name: Sales, dtype: int64

分组聚合:计算每个类别的总销售额

有了纯数字的销售额Series,我们现在可以结合Category列进行分组求和了。

# 按Category分组并求和所有销售额
total_sales_per_category = sales_numbers.groupby(df['Category']).sum()
print("\n每个类别的总销售额:")
print(total_sales_per_category)

输出结果:

每个类别的总销售额:
Category
Chair      15
Cushion     8
Mats       12
Table       4
Name: Sales, dtype: int64

这里,Chair的总销售额是 3 + 12 = 15,Table的总销售额是 1 + 3 = 4,这与我们的预期相符。

进阶应用:条件性分组聚合

有时,我们可能需要根据额外的条件进行聚合。例如,只计算Paid列为Yes的销售额。

为了实现条件性聚合,我们可以在提取数字之前,先根据条件对Sales列进行预处理。对于Paid列为No的行,我们可以将Sales值替换为'0'。这样,即使这些行的原始Sales值包含数字,它们在提取和转换后也会变为0,从而不影响最终的求和结果。

# 只计算Paid为'Yes'的销售额
paid_sales_numbers = (
    df['Sales']
    .where(df['Paid'] == 'Yes', other='0') # 如果Paid不是'Yes',则将Sales列的值替换为'0'
    .str.extract('^(\d+)', expand=False)
    .astype(int)
    .groupby(df['Category'])
    .sum()
)
print("\n每个类别的已支付销售额:")
print(paid_sales_numbers)

输出结果:

每个类别的已支付销售额:
Category
Chair       3
Cushion     8
Mats       12
Table       4
Name: Sales, dtype: int64

在这个例子中,Chair类别的总销售额从15降至3,因为其中一笔“12 Chairs”的销售其Paid状态为No,在计算时被忽略(或计为0)。

注意事项与总结

  1. 正则表达式的灵活性: str.extract 的强大之处在于其与正则表达式的结合。本教程使用了简单的^(\d+)来匹配开头的数字,但如果数字出现在字符串的其他位置(例如“Item_123Count”),您需要调整正则表达式(如`(\d+)_`)。
  2. 数据类型转换: str.extract 提取的结果默认是字符串类型。在进行数值计算前,务必使用astype(int)或astype(float)将其转换为合适的数值类型。
  3. 处理非匹配项: 如果str.extract没有找到匹配项,它将返回NaN。在尝试astype(int)时,NaN会导致错误。在使用astype(int)之前,您可能需要使用fillna(0)或其他策略来处理这些NaN值。在条件性聚合的例子中,我们巧妙地使用了where(..., other='0')来避免NaN,确保所有值都能转换为整数。
  4. expand=False 的作用: str.extract 默认返回一个DataFrame。当正则表达式中只有一个捕获组,并且我们希望结果是一个Series时,设置expand=False会更简洁方便。

通过本教程,您应该掌握了如何利用Pandas的str.extract方法结合正则表达式,从包含混合文本和数字的列中提取所需的数值信息,并进一步进行分组聚合。这些技巧对于数据清洗和预处理至关重要,能帮助您更高效地分析复杂数据集。

相关专题

更多
js正则表达式
js正则表达式

php中文网为大家提供各种js正则表达式语法大全以及各种js正则表达式使用的方法,还有更多js正则表达式的相关文章、相关下载、相关课程,供大家免费下载体验。

510

2023.06.20

正则表达式不包含
正则表达式不包含

正则表达式,又称规则表达式,,是一种文本模式,包括普通字符和特殊字符,是计算机科学的一个概念。正则表达式使用单个字符串来描述、匹配一系列匹配某个句法规则的字符串,通常被用来检索、替换那些符合某个模式的文本。php中文网给大家带来了有关正则表达式的相关教程以及文章,希望对大家能有所帮助。

249

2023.07.05

java正则表达式语法
java正则表达式语法

java正则表达式语法是一种模式匹配工具,它非常有用,可以在处理文本和字符串时快速地查找、替换、验证和提取特定的模式和数据。本专题提供java正则表达式语法的相关文章、下载和专题,供大家免费下载体验。

742

2023.07.05

java正则表达式匹配字符串
java正则表达式匹配字符串

在Java中,我们可以使用正则表达式来匹配字符串。本专题为大家带来java正则表达式匹配字符串的相关内容,帮助大家解决问题。

213

2023.08.11

正则表达式空格
正则表达式空格

正则表达式空格可以用“s”来表示,它是一个特殊的元字符,用于匹配任意空白字符,包括空格、制表符、换行符等。本专题为大家提供正则表达式相关的文章、下载、课程内容,供大家免费下载体验。

351

2023.08.31

Python爬虫获取数据的方法
Python爬虫获取数据的方法

Python爬虫可以通过请求库发送HTTP请求、解析库解析HTML、正则表达式提取数据,或使用数据抓取框架来获取数据。更多关于Python爬虫相关知识。详情阅读本专题下面的文章。php中文网欢迎大家前来学习。

293

2023.11.13

正则表达式空格如何表示
正则表达式空格如何表示

正则表达式空格可以用“s”来表示,它是一个特殊的元字符,用于匹配任意空白字符,包括空格、制表符、换行符等。想了解更多正则表达式空格怎么表示的内容,可以访问下面的文章。

234

2023.11.17

正则表达式中如何匹配数字
正则表达式中如何匹配数字

正则表达式中可以通过匹配单个数字、匹配多个数字、匹配固定长度的数字、匹配整数和小数、匹配负数和匹配科学计数法表示的数字的方法匹配数字。更多关于正则表达式的相关知识详情请看本专题下面的文章。php中文网欢迎大家前来学习。

528

2023.12.06

Golang 性能分析与pprof调优实战
Golang 性能分析与pprof调优实战

本专题系统讲解 Golang 应用的性能分析与调优方法,重点覆盖 pprof 的使用方式,包括 CPU、内存、阻塞与 goroutine 分析,火焰图解读,常见性能瓶颈定位思路,以及在真实项目中进行针对性优化的实践技巧。通过案例讲解,帮助开发者掌握 用数据驱动的方式持续提升 Go 程序性能与稳定性。

0

2026.01.22

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Go 教程
Go 教程

共32课时 | 4万人学习

Go语言实战之 GraphQL
Go语言实战之 GraphQL

共10课时 | 0.8万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号