使用 Pandas 合并 Excel 数据并添加状态列

花韻仙語

发布时间：2025-08-20 16:12:01

346人浏览过

来源于php中文网

原创

使用 pandas 合并 excel 数据并添加状态列

本文档旨在指导您如何使用 Pandas 库合并两个 Excel 文件的数据，并基于指定列的比较结果，自动添加一个 "Status" 列，标识数据是否匹配。我们将通过一个完整的示例代码，详细解释每一步骤，并提供注意事项，帮助您轻松完成数据比对和状态标记任务。

1. 环境准备

首先，确保您已安装 Pandas 库。如果没有，可以使用 pip 进行安装：

pip install pandas

2. 代码实现

以下是一个完整的 Python 脚本，用于实现 Excel 数据的合并、比较和状态标记：

import pandas as pd

class ExcelComparator:
    def __init__(self, src_file_name, src_sheet_name, src_pk, src_cols_to_compare, tgt_cols_to_compare, tgt_file_name,
                 tgt_sheet_name, tgt_pk, target_excel):
        self.src_file_name = src_file_name
        self.src_sheet_name = src_sheet_name
        self.src_pk = src_pk
        self.src_cols_to_compare = src_cols_to_compare
        self.tgt_cols_to_compare = tgt_cols_to_compare
        self.tgt_file_name = tgt_file_name
        self.tgt_sheet_name = tgt_sheet_name
        self.tgt_pk = tgt_pk
        self.target_excel = target_excel

    def highlight_cells(self, row):
        styles = [''] * len(row)
        pk_cols = [col for col in row.index if col in [self.src_pk, self.tgt_pk]]

        for i, col in enumerate(row.index):
            if i % 2 == 0 and col not in pk_cols:
                src_col = col
                tgt_col = row.index[i - 1]  # Adjusted to get the previous column

                if row[src_col] == row[tgt_col]:
                    styles[i], styles[i - 1] = 'background-color:lightgreen', 'background-color:lightgreen'
                elif pd.isnull(row[src_col]) or pd.isnull(row[tgt_col]):
                    styles[i], styles[i - 1] = 'background-color:yellow', 'background-color:yellow'
                else:
                    styles[i], styles[i - 1] = 'background-color:lightcoral', 'background-color:lightcoral'

        return styles

    def calculate_status(self, row):
        for i in range(len(row.index) - 1, 0, -2):
            src_col = row.index[i]
            tgt_col = row.index[i - 1]

            if row[src_col] != row[tgt_col]:
                return 'Fail'

        return 'Pass'

    def read_and_compare(self):
        src_df = pd.read_excel(self.src_file_name, sheet_name=self.src_sheet_name)
        tgt_df = pd.read_excel(self.tgt_file_name, sheet_name=self.tgt_sheet_name)

        result = src_df.merge(tgt_df, how='inner', left_on=self.src_pk, right_on=self.tgt_pk)
        result_columns = [self.src_pk] + [col for pair in zip(self.src_cols_to_compare, self.tgt_cols_to_compare) for col
                                         in pair]

        result = result[result_columns]
        result['Status'] = result.apply(self.calculate_status, axis=1)

        result.style.apply(self.highlight_cells, axis=1).to_excel(self.target_excel)


# Example usage
comparator = ExcelComparator(
    src_file_name='source.xlsx',
    src_sheet_name='Sheet1',
    src_pk='ID',
    src_cols_to_compare=['Name', 'Salary'],
    tgt_cols_to_compare=['FirstName', 'Sal'],
    tgt_file_name='target.xlsx',
    tgt_sheet_name='Sheet1',
    tgt_pk='EMP_ID',
    target_excel='result.xlsx'
)

comparator.read_and_compare()

3. 代码详解

该代码主要分为以下几个部分：

空心菜的米库

1，对界面进行了美化2，对文件里边相同代码进行了综合3，增加了点击次数统计，并对3次点击以上的域名增加热门字样4，对本站出售和个人出售进行了划分5，增加钻石状态说明6，增加了完整的后台界面7，增加对资料修改功能8，增加回收站，可以任意删除域名、恢复删除域名和永久删除数据9，还有其他的细节大家自己看~10.增加域名证书显示11.域名到期时间采用日历控件形式12.后台登陆添加了验证码功能13.还有很多

下载

ExcelComparator 类： 封装了所有操作，方便复用。
- __init__ 方法： 初始化类的各种参数，包括源文件、目标文件、主键列、需要比较的列等。
- highlight_cells 方法： 根据比较结果，对单元格进行颜色标记。绿色表示匹配，黄色表示空值，红色表示不匹配。
- calculate_status 方法： 遍历每一行，比较指定的列，如果所有列都匹配，则状态为 "Pass"，否则为 "Fail"。
- read_and_compare 方法： 读取源文件和目标文件，根据主键进行合并，选择需要的列，计算状态，并将结果写入到目标 Excel 文件。
示例用法： 创建 ExcelComparator 对象，并调用 read_and_compare 方法。

关键步骤解释：

读取 Excel 文件： 使用 pd.read_excel() 函数读取源文件和目标文件。
合并数据： 使用 pd.merge() 函数，根据主键列将两个 DataFrame 合并。 how='inner' 表示只保留两个 DataFrame 中都存在的键。
选择列： 根据 result_columns 列表，选择需要的列。
计算状态： 使用 apply() 函数，对每一行调用 calculate_status 方法，计算状态，并将结果添加到新的 "Status" 列。
颜色标记： 使用 style.apply() 函数，对单元格进行颜色标记。
写入 Excel 文件： 使用 to_excel() 函数，将结果写入到目标 Excel 文件。

4. 使用方法

准备数据： 创建两个 Excel 文件，例如 source.xlsx 和 target.xlsx，并确保它们包含示例数据中所示的列。
修改参数： 根据实际情况，修改示例用法中的参数，例如文件名、Sheet 名称、主键列、需要比较的列等。
运行代码： 运行 Python 脚本。
查看结果： 查看生成的 result.xlsx 文件，其中包含合并后的数据和 "Status" 列。

5. 注意事项

确保源文件和目标文件中都存在指定的主键列，并且主键列的数据类型一致。
src_cols_to_compare 和 tgt_cols_to_compare 列表中的列的顺序必须一一对应。
如果需要比较的列包含空值，可以使用 pd.isnull() 函数进行判断。
可以根据实际需求，修改 highlight_cells 方法中的颜色标记规则。
可以根据实际需求，修改 calculate_status 方法中的状态计算规则。

6. 总结

本文档提供了一个使用 Pandas 合并 Excel 数据并添加状态列的完整示例。通过学习本文档，您可以掌握使用 Pandas 进行数据处理的基本技巧，并将其应用到实际工作中。记住根据您的具体数据和需求调整代码。

如何在 NumPy 中从 Python 调用 C 函数：源码级原理与实现路径

如何在 NumPy 中从 Python 调用 C 函数：源码级调用机制解析

如何用 Python 实现基于双数组时间点的嵌套闹钟系统

Python 装饰器如何正确处理带参数函数？

Python 如何正确拆分大型项目包结构？

相关专题

python开发工具

php中文网为大家提供各种python开发工具，好的开发工具，可帮助开发者攻克编程学习中的基础障碍，理解每一行源代码在程序执行时在计算机中的过程。php中文网还为大家带来python相关课程以及相关文章等内容，供大家免费下载使用。

759

2023.06.15

python打包成可执行文件

本专题为大家带来python打包成可执行文件相关的文章，大家可以免费的下载体验。

639

2023.07.20

python能做什么

python能做的有：可用于开发基于控制台的应用程序、多媒体部分开发、用于开发基于Web的应用程序、使用python处理数据、系统编程等等。本专题为大家提供python相关的各种文章、以及下载和课程。

761

2023.07.25

format在python中的用法

Python中的format是一种字符串格式化方法，用于将变量或值插入到字符串中的占位符位置。通过format方法，我们可以动态地构建字符串，使其包含不同值。php中文网给大家带来了相关的教程以及文章，欢迎大家前来阅读学习。

618

2023.07.31

python教程

Python已成为一门网红语言，即使是在非编程开发者当中，也掀起了一股学习的热潮。本专题为大家带来python教程的相关文章，大家可以免费体验学习。

1265

2023.08.03

python环境变量的配置

Python是一种流行的编程语言，被广泛用于软件开发、数据分析和科学计算等领域。在安装Python之后，我们需要配置环境变量，以便在任何位置都能够访问Python的可执行文件。php中文网给大家带来了相关的教程以及文章，欢迎大家前来学习阅读。

548

2023.08.04

python eval

eval函数是Python中一个非常强大的函数，它可以将字符串作为Python代码进行执行，实现动态编程的效果。然而，由于其潜在的安全风险和性能问题，需要谨慎使用。php中文网给大家带来了相关的教程以及文章，欢迎大家前来学习阅读。

579

2023.08.04

scratch和python区别

scratch和python的区别：1、scratch是一种专为初学者设计的图形化编程语言，python是一种文本编程语言；2、scratch使用的是基于积木的编程语法，python采用更加传统的文本编程语法等等。本专题为大家提供scratch和python相关的文章、下载、课程内容，供大家免费下载体验。

709

2023.08.11