Pandas DataFrame行聚合：保留独特属性并生成结构化输出

碧海醫心

发布时间：2025-10-19 13:38:17

991人浏览过

来源于php中文网

原创

Pandas DataFrame行聚合：保留独特属性并生成结构化输出

本文旨在解决pandas dataframe中将多行数据聚合为单行时，如何同时保留并结构化展示每行特有的详细属性（如不同技术人员的活动及其时间）的挑战。通过利用`groupby().apply()`结合自定义聚合函数，我们能够将组内数据动态转换为指定列，从而在不丢失关键信息的前提下，实现高度定制化的数据扁平化处理，适用于需要将多维度细节整合到单一记录的场景。

在数据分析和处理中，我们经常会遇到需要将DataFrame中的多行记录聚合为单行的情况。然而，当这些多行记录包含需要被单独识别和展示的独特属性时，例如一个工作任务（Job #）可能由多名技术人员（Name）完成，每名技术人员又有多项活动（Timesheet Activity）和对应的活动日期（Timesheet Activity Date），简单的聚合操作（如mean(), sum(), first()）往往会导致信息的丢失或混淆。本教程将深入探讨如何使用Pandas的groupby().apply()方法，结合自定义聚合函数，实现这种复杂的数据扁平化需求，确保所有关键信息都能以结构化、易于理解的方式呈现在最终的单行记录中。

挑战与目标

假设我们有一个包含工作任务详情的DataFrame，其中每个工作任务（Job #）可能有多条记录，代表不同技术人员的不同活动。原始数据示例如下：

index	Job #	Name	Timesheet Activity	Customer ID	Invoice Date	...	Timesheet Activity Date	Duration (Decimal)
5123	56618.0	Carlos Meza	Driving	5779854.0	2023-10-26	...	2023-10-24, 2023-10-25	0.9
5124124	56618.0	Carlos Meza	Working	5779854.0	2023-10-26	...	2023-10-24, 2023-10-25	14.33
5125	56618.0	Donald Pearson	Driving	5779854.0	2023-10-26	...	2023-10-24, 2023-10-26	1.2
...	...	...	...	...	...	...	...	...

我们的目标是将每个Job #的所有相关信息聚合到一行中，同时为每个技术人员及其各项活动（如驾驶、工作）创建独立的列，以保留其独特的活动日期和持续时间。期望的输出结构示例如下：

Customer ID	Invoice Date	Job #	Assigned Technicians	Primary Technician	Total Technician Paid Time	Technician #1	Driving Activity Date(s) #1	Timesheet Activity #1	Total Driving Duration (Decimal) #1	Working Activity Date(s) #1	Activity #1	Total Working Time Duration #1	Technician #2	...
5779854.0	2023-10-26	56618.0	Donald Pearson, Carlos Meza, Joshua Williams	Carlos Meza	50.88333333	Carlos Meza	2023-10-24, 2023-10-25	Driving	0.9	2023-10-24, 2023-10-25	Working	14.33333333	Donald Pearson	...

解决方案核心：groupby().apply()

Pandas的groupby().apply()方法是解决此类复杂聚合问题的强大工具。当标准的聚合函数无法满足需求时，apply()允许我们对每个分组应用一个自定义函数。这个自定义函数可以执行任意复杂的操作，包括遍历组内的行、创建新的列、甚至返回一个全新的Series或DataFrame，从而实现高度灵活的数据转换。

Powtoon

AI创建令人惊叹的动画短片及简报

下载

在这种情况下，我们将为每个Job #组定义一个函数。该函数将遍历组内的所有技术人员，并为每个技术人员的每种活动类型动态创建一组新的列来存储其详细信息。

实现自定义聚合函数

为了实现上述目标，我们需要创建一个自定义函数，它接收一个DataFrame组作为输入，并返回一个包含所有聚合信息的Series。

首先，我们准备一个示例DataFrame：

import pandas as pd
from io import StringIO

# 示例数据
data = """
index,Job #,Name,Timesheet Activity,Customer ID,Invoice Date,Completion Date,Invoice #,Assigned Technicians,Primary Technician,Business Unit,Prevailing Wage,Booked By,Job Number,Timesheet Activity Date,Duration (Decimal)
5123

如何在 Kivy 应用中正确引用屏幕内的控件（如 TextInput）

Django 外部脚本中正确配置 ORM 环境以加载自定义 App 模块

Django 外部脚本中正确配置 ORM 并导入自定义 App 模块的完整指南

Django 外部脚本中正确配置 ORM 并导入自定义 App 模块

Flask 中使用 url_for() 生成路由链接的正确方法

相关标签:

app 工具 ai 聚合函数 pandas date 数据分析

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：Python递归函数中的局部变量与返回值陷阱解析下一篇：深入理解Python递归：局部变量与返回值传递机制

作者最新文章

如何在 PHP 中将多个复选框选择结果安全拼接并写入邮件正文

2026-01-21 14:58

可爱戴安娜！《识质存在》新实机展示

2026-01-21 14:59

Using a Global Variable Correctly in Go

2026-01-21 15:17

如何在隐藏必填字段未填写时将焦点移至自定义元素

2026-01-21 15:21

美国任天堂前总裁“库巴”履新！和前Xbox高管当同事

2026-01-21 15:27

显卡涨价潮杀到！微星率先调涨：华硕、技嘉紧随

2026-01-21 15:27

《零红蝶：重制版》新视频女鬼从天而降

2026-01-21 15:28

鹰角《明日方舟：终末地》M站开分79！首发卖相不错但需时间检验

2026-01-21 15:35

夸克怎么变成AI了

2026-01-21 15:40

如何使用 Gson 正确解析嵌套多层 JSON 文件（含对象与数组）

2026-01-21 16:00

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI大模型

开放平台

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI大模型

通义千问

阿里巴巴推出的全能AI助手

AI大模型

腾讯元宝

腾讯混元平台推出的AI助手

文档处理

Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI大模型

中文写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

中文写作

写作工具

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接

图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI大模型

中文写作

智谱清言 - 免费全能的AI助手

AI大模型

PC软件

相关专题

Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧，涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估，以及基于实际业务场景的时间序列项目实操，帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

数据分析的方法

数据分析的方法有：对比分析法，分组分析法，预测分析法，漏斗分析法，AB测试分析法，象限分析法，公式拆解法，可行域分析法，二八分析法，假设性分析法。php中文网为大家带来了数据分析的相关知识、以及相关文章等内容。

469

2023.07.04

数据分析方法有哪几种

数据分析方法有：1、描述性统计分析；2、探索性数据分析；3、假设检验；4、回归分析；5、聚类分析。本专题为大家提供数据分析方法的相关的文章、下载、课程内容，供大家免费下载体验。

280

2023.08.07

网站建设功能有哪些

网站建设功能包括信息发布、内容管理、用户管理、搜索引擎优化、网站安全、数据分析、网站推广、响应式设计、社交媒体整合和电子商务等功能。这些功能可以帮助网站管理员创建一个具有吸引力、可用性和商业价值的网站，实现网站的目标。

733

2023.10.16

数据分析网站推荐

数据分析网站推荐：1、商业数据分析论坛；2、人大经济论坛-计量经济学与统计区；3、中国统计论坛；4、数据挖掘学习交流论坛；5、数据分析论坛；6、网站数据分析；7、数据分析；8、数据挖掘研究院；9、S-PLUS、R统计论坛。想了解更多数据分析的相关内容，可以阅读本专题下面的文章。

512

2024.03.13

Python 数据分析处理

本专题聚焦 Python 在数据分析领域的应用，系统讲解 Pandas、NumPy 的数据清洗、处理、分析与统计方法，并结合数据可视化、销售分析、科研数据处理等实战案例，帮助学员掌握使用 Python 高效进行数据分析与决策支持的核心技能。

2025.09.08

Python 数据分析与可视化

本专题聚焦 Python 在数据分析与可视化领域的核心应用，系统讲解数据清洗、数据统计、Pandas 数据操作、NumPy 数组处理、Matplotlib 与 Seaborn 可视化技巧等内容。通过实战案例（如销售数据分析、用户行为可视化、趋势图与热力图绘制），帮助学习者掌握从原始数据到可视化报告的完整分析能力。

2025.10.14