0

0

Pandas DataFrame高级重塑:拼接多级列索引与行索引

碧海醫心

碧海醫心

发布时间:2025-11-09 11:36:53

|

502人浏览过

|

来源于php中文网

原创

pandas dataframe高级重塑:拼接多级列索引与行索引

本文旨在教授如何使用Pandas高效地重塑具有多级列索引的DataFrame。我们将通过一个具体示例,演示如何将DataFrame的最低层列索引与行索引进行拼接,并将其转换为新的列名,同时将原有的顶级列索引转换为新的行索引,最终得到一个扁平化、易于分析的数据结构。核心操作包括`stack()`、`transpose()`以及`Index.map()`,帮助用户灵活处理复杂的数据转换需求。

在数据分析和处理中,我们经常需要对DataFrame的结构进行重塑,以适应不同的分析需求或可视化工具。当DataFrame具有多级索引时,这种重塑操作可能会变得复杂。本教程将详细介绍如何将一个具有多级列索引(例如,岛屿和年份)和单级行索引(例如,月份)的DataFrame,转换为以岛屿为行索引,以月份和年份拼接后的字符串为新列名的扁平化结构。

初始DataFrame结构

假设我们有一个DataFrame df,其结构如下所示。它展示了不同岛屿在不同年份的月度数据。

Island St Thomas         St. Croix        
Year        2022    2023      2022    2023
Month                                     
JAN       55,086  60,470    11,550  12,755
FEB       57,929  56,826    12,441  13,289
MAR       72,103  64,249    14,094  15,880
...
NOV       44,500     NaN     9,635     NaN
DEC       58,735     NaN    12,661     NaN

在这个DataFrame中:

  • 列索引是多级的,第一级是Island(St Thomas, St. Croix),第二级是Year(2022, 2023)。
  • 行索引是单级的,代表Month(JAN, FEB, MAR等)。
  • 数据值是各月度数据。

我们的目标是将其重塑为:

  • 行索引为Island(St Thomas, St. Croix)。
  • 列索引为Month和Year的拼接(例如 JAN2022, FEB2022, ... DEC2023)。
  • 最终形成一个2行24列(2个岛屿 x 12个月 x 2年)的DataFrame。

重塑DataFrame的步骤

为了实现上述目标,我们将利用Pandas的stack()、transpose()和Index.map()方法。

步骤一:使用 stack() 移动最低层列索引

df.stack() 方法用于将DataFrame的“列”转换为“行”。具体来说,它会将最低层的列索引(在本例中是Year)移动到行索引中,从而增加行索引的级别。

import pandas as pd

# 假设df是前面提到的初始DataFrame
# ... (此处省略df的创建代码,详情请参考问题描述中的原始代码)

# 示例DataFrame的创建(用于演示,实际使用时请替换为你的df)
data = {
    ('St Thomas', '2022'): ['55,086', '57,929', '72,103', '67,469', '60,092', '67,026', '66,353', '50,660', '24,507', '34,025', '44,500', '58,735'],
    ('St Thomas', '2023'): ['60,470', '56,826', '64,249', '56,321', '49,534', '56,950', '61,110', '42,745', '25,047', '34,462', None, None],
    ('St. Croix', '2022'): ['11,550', '12,441', '14,094', '12,196', '13,385', '14,009', '13,768', '10,673', '6,826', '10,351', '9,635', '12,661'],
    ('St. Croix', '2023'): ['12,755', '13,289', '15,880', '13,092', '16,497', '15,728', '16,879', '12,102', '6,298', '9,398', None, None]
}
months = ['JAN', 'FEB', 'MAR', 'APR', 'MAY', 'JUN', 'JUL', 'AUG', 'SEP', 'OCT', 'NOV', 'DEC']
index = pd.Index(months, name='Month')
columns = pd.MultiIndex.from_product([["St Thomas", "St. Croix"], ["2022", "2023"]], names=["Island", "Year"])
df = pd.DataFrame(data, index=index, columns=columns)


stacked_df = df.stack()
print("--- 经过 stack() 后的 DataFrame ---")
print(stacked_df)

stacked_df 的结构将变为:

Month  Island   Year
JAN    St Thomas 2022    55,086
                 2023    60,470
       St. Croix 2022    11,550
                 2023    12,755
FEB    St Thomas 2022    57,929
                 2023    56,826
...

此时,stacked_df 是一个Series,其索引是一个三级MultiIndex:(Month, Island, Year)。

讯飞智文
讯飞智文

一键生成PPT和Word,让学习生活更轻松。

下载

步骤二:使用 T (转置) 交换行与列

接下来,我们需要将Island作为新的行索引,并将(Month, Year)组合作为新的列索引。这可以通过对 stacked_df 进行转置 (.T) 来实现。由于 stacked_df 是一个Series,转置操作会将其转换为一个DataFrame,其中Series的MultiIndex会变为DataFrame的MultiIndex列。

out = stacked_df.T
print("\n--- 经过 T (转置) 后的 DataFrame ---")
print(out)

out 的结构将变为:

Island  St Thomas                                 St. Croix                                 
Month         JAN     FEB     MAR     APR     MAY     JUN     JUL     AUG     SEP     OCT     NOV     DEC     JAN     FEB     MAR     APR     MAY     JUN     JUL     AUG     SEP     OCT     NOV     DEC
Year         2022    2023    2022    2023    2022    2023    2022    2023    2022    2023    2022    2023    2022    2023    2022    2023    2022    2023    2022    2023    2022    2023    2022    2023
St Thomas  55,086  60,470  57,929  56,826  72,103  64,249  67,469  56,321  60,092  49,534  67,026  56,950  66,353  61,110  50,660  42,745  24,507  25,047  34,025  34,462  44,500  58,735     NaN     NaN
St. Croix  11,550  12,755  12,441  13,289  14,094  15,880  12,196  13,092  13,385  16,497  14,009  15,728  13,768  16,879  10,673  12,102   6,826   6,298  10,351   9,398   9,635  12,661     NaN     NaN

注意:上述输出中的行和列是反转的,因为out的索引是Island,而列是(Month, Year)。

步骤三:扁平化列MultiIndex

现在,out DataFrame的列是一个MultiIndex,由(Month, Year)组成。我们需要将它们合并成一个单一的字符串,例如 JAN2022。这可以通过对列索引使用 map() 方法来完成。

out.columns = out.columns.map(lambda x: f'{x[0]}{x[1]}')
# 另一种简洁的写法是:
# out.columns = map(''.join, out.columns)

print("\n--- 最终重塑后的 DataFrame ---")
print(out)

最终的 out DataFrame将是:

          JAN2022 JAN2023 FEB2022 FEB2023 MAR2022 MAR2023 APR2022 APR2023 MAY2022 MAY2023 JUN2022 JUN2023 JUL2022 JUL2023 AUG2022 AUG2023 SEP2022 SEP2023 OCT2022 OCT2023 NOV2022 DEC2022
Island                                                                                                                                                                                   
St Thomas  55,086  60,470  57,929  56,826  72,103  64,249  67,469  56,321  60,092  49,534  67,026  56,950  66,353  61,110  50,660  42,745  24,507  25,047  34,025  34,462  44,500  58,735
St. Croix  11,550  12,755  12,441  13,289  14,094  15,880  12,196  13,092  13,385  16,497  14,009  15,728  13,768  16,879  10,673  12,102   6,826   6,298  10,351   9,398   9,635  12,661

这正是我们想要的结果:以岛屿为行索引,以月份和年份拼接后的字符串为列名。

完整代码示例

import pandas as pd

# 模拟初始DataFrame的创建
# 实际应用中,df将由tabula.read_pdf等方式生成
data = {
    ('St Thomas', '2022'): ['55,086', '57,929', '72,103', '67,469', '60,092', '67,026', '66,353', '50,660', '24,507', '34,025', '44,500', '58,735'],
    ('St Thomas', '2023'): ['60,470', '56,826', '64,249', '56,321', '49,534', '56,950', '61,110', '42,745', '25,047', '34,462', None, None],
    ('St. Croix', '2022'): ['11,550', '12,441', '14,094', '12,196', '13,385', '14,009', '13,768', '10,673', '6,826', '10,351', '9,635', '12,661'],
    ('St. Croix', '2023'): ['12,755', '13,289', '15,880', '13,092', '16,497', '15,728', '16,879', '12,102', '6,298', '9,398', None, None]
}
months = ['JAN', 'FEB', 'MAR', 'APR', 'MAY', 'JUN', 'JUL', 'AUG', 'SEP', 'OCT', 'NOV', 'DEC']
index = pd.Index(months, name='Month')
columns = pd.MultiIndex.from_product([["St Thomas", "St. Croix"], ["2022", "2023"]], names=["Island", "Year"])
df = pd.DataFrame(data, index=index, columns=columns)

print("原始 DataFrame:")
print(df)

# 执行重塑操作
out = df.stack().T
out.columns = out.columns.map(lambda x: f'{x[0]}{x[1]}')

print("\n重塑后的 DataFrame:")
print(out)

注意事项

  1. 数据类型转换: 在实际应用中,如果数据包含逗号(如 55,086),可能需要先进行数据清洗,将其转换为数值类型(例如 pd.to_numeric(df.replace(',', '', regex=True))),以便进行后续的数值计算。本教程主要关注DataFrame的结构重塑。
  2. NaN 值的处理: stack() 默认会丢弃 NaN 值。如果希望保留所有可能的组合,即使它们的值为 NaN,可以使用 df.stack(dropna=False)。在本例中,由于转置后 NaN 值仍然存在,影响不大,但了解其行为很重要。
  3. 索引层级: stack() 默认操作的是最内层的列索引。如果需要操作其他层级,可以使用 df.stack(level=N),其中 N 是索引的整数位置或名称。
  4. 性能: 对于非常大的DataFrame,这些操作可能会消耗较多的内存和计算时间。在处理海量数据时,应考虑性能优化。

总结

本教程详细介绍了如何利用Pandas的stack()、transpose()和Index.map()方法,将一个具有复杂多级列索引的DataFrame重塑为更扁平、更易于分析的结构。这种技术在处理从非结构化数据源(如PDF表格)中提取的数据时尤其有用,能够帮助数据科学家和分析师高效地准备数据,以进行后续的统计分析、机器学习建模或数据可视化。掌握这些重塑技巧,将极大地提升您使用Pandas处理复杂数据结构的能力。

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

51

2025.12.04

数据类型有哪几种
数据类型有哪几种

数据类型有整型、浮点型、字符型、字符串型、布尔型、数组、结构体和枚举等。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

301

2023.10.31

php数据类型
php数据类型

本专题整合了php数据类型相关内容,阅读专题下面的文章了解更多详细内容。

222

2025.10.31

js 字符串转数组
js 字符串转数组

js字符串转数组的方法:1、使用“split()”方法;2、使用“Array.from()”方法;3、使用for循环遍历;4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容,供大家免费下载体验。

254

2023.08.03

js截取字符串的方法
js截取字符串的方法

js截取字符串的方法有substring()方法、substr()方法、slice()方法、split()方法和slice()方法。本专题为大家提供字符串相关的文章、下载、课程内容,供大家免费下载体验。

206

2023.09.04

java基础知识汇总
java基础知识汇总

java基础知识有Java的历史和特点、Java的开发环境、Java的基本数据类型、变量和常量、运算符和表达式、控制语句、数组和字符串等等知识点。想要知道更多关于java基础知识的朋友,请阅读本专题下面的的有关文章,欢迎大家来php中文网学习。

1463

2023.10.24

字符串介绍
字符串介绍

字符串是一种数据类型,它可以是任何文本,包括字母、数字、符号等。字符串可以由不同的字符组成,例如空格、标点符号、数字等。在编程中,字符串通常用引号括起来,如单引号、双引号或反引号。想了解更多字符串的相关内容,可以阅读本专题下面的文章。

617

2023.11.24

java读取文件转成字符串的方法
java读取文件转成字符串的方法

Java8引入了新的文件I/O API,使用java.nio.file.Files类读取文件内容更加方便。对于较旧版本的Java,可以使用java.io.FileReader和java.io.BufferedReader来读取文件。在这些方法中,你需要将文件路径替换为你的实际文件路径,并且可能需要处理可能的IOException异常。想了解更多java的相关内容,可以阅读本专题下面的文章。

548

2024.03.22

php与html混编教程大全
php与html混编教程大全

本专题整合了php和html混编相关教程,阅读专题下面的文章了解更多详细内容。

11

2026.01.13

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
React 教程
React 教程

共58课时 | 3.6万人学习

Pandas 教程
Pandas 教程

共15课时 | 0.9万人学习

ASP 教程
ASP 教程

共34课时 | 3.5万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号