使用 Pandas 实现条件性累积最小值（cummin）重置的技巧

花韻仙語

发布时间：2025-11-23 10:34:01

198人浏览过

来源于php中文网

原创

使用 pandas 实现条件性累积最小值（cummin）重置的技巧

本文深入探讨了在 Pandas DataFrame 中，如何创建一个新列 c，该列的值基于列 b 的累积最小值 (cummin())，但其计算过程会根据列 a 和 c 的前一个值的特定条件进行动态重置。我们将通过一个复杂的布尔掩码和分组操作的组合，展示一个高效且完全向量化的解决方案，以应对这种递归依赖的计算挑战。

在数据分析和处理中，我们经常需要根据复杂的业务逻辑创建新的特征列。其中一种常见的需求是计算累积最小值 (cummin())，但更具挑战性的是，当这个累积最小值需要在特定条件下“重置”并重新开始计算时。本教程将详细介绍如何使用 Pandas 库，以向量化的方式解决一个具体的问题：创建一个新列 c，它基于列 b 的累积最小值，但在满足 df.a.shift(1) > df.c.shift(1) 这一条件时，c 的值变为当前 b 的值，并且 cummin() 的计算从该点重新开始。

问题描述与初始数据

假设我们有一个 Pandas DataFrame，包含两列 a 和 b：

import pandas as pd

df = pd.DataFrame(
    {
        'a': [98, 97, 100, 135, 103, 100, 105, 109, 130],
        'b': [100, 103, 101, 105, 110, 120, 101, 150, 160]
    }
)

print("原始 DataFrame:")
print(df)

我们的目标是创建列 c，其计算规则如下：

初始时，c 的值是 b 的累积最小值 (df.b.cummin())。
当满足条件 df.a.shift(1) > df.c.shift(1) 时，当前行的 c 值应等于当前行的 b 值。
更重要的是，一旦条件满足，cummin() 的计算将从当前行开始“重置”，即后续行的 c 值将是当前行 b 值开始的累积最小值。

这是一个具有挑战性的问题，因为它涉及到对 c 列的递归依赖（c 的计算依赖于其自身的先前值），这使得简单的向量化操作变得困难。

期望的输出 df 如下：

     a    b    c
0   98  100  100
1   97  103  100
2  100  101  100
3  135  105  100
4  103  110  110  # 条件触发，c=b，cummin重置
5  100  120  110  # 从上一行b=110开始的cummin
6  105  101  101  # 从上一行b=110开始的cummin
7  109  150  150  # 条件触发，c=b，cummin重置
8  130  160  150  # 从上一行b=150开始的cummin

向量化解决方案

为了解决这种带有条件重置的累积计算问题，我们可以利用 Pandas 的 groupby 和布尔掩码 (mask, where) 功能。以下是实现所需逻辑的向量化代码：

m1 = df["b"].le(df["a"].shift())
cm = df["b"].groupby(m1.cumsum()).cummin()
m2 = (df["b"].le(cm) | df["a"].shift().le(cm.shift()))
df["c"] = cm.where(m2, df["b"].mask(m2).cummin())

print("\n生成列 'c' 后的 DataFrame:")
print(df)

解决方案详解

这个解决方案通过引入几个中间布尔掩码和分组累积操作，巧妙地避免了递归计算，实现了完全的向量化。让我们逐步解析每个部分的含义：

Petalica Paint

用AI为你的画自动上色！

下载

m1 = df["b"].le(df["a"].shift())
- 这一步创建了一个布尔序列 m1，用于标识 b 的当前值是否小于或等于 a 的前一个值。
- df["a"].shift() 将 a 列向下移动一位，使得当前行可以与前一行的 a 值进行比较。
- le() 是 "less than or equal to" 的缩写。
- m1 的作用是识别潜在的“重置点”或“新组的开始”。当 b 相对前一个 a 变得足够小（或相等）时，这可能意味着一个新的累积最小值序列的开始。
示例 m1 值的生成：
```
a_s (a.shift())  b    b <= a_s  -> m1
NaN              100  False
98.0             103  False
97.0             101  False
100.0            105  False
135.0            110  True   # b(110) <= a_s(135)
103.0            120  False
100.0            101  False
105.0            150  False
109.0            160  False
```
cm = df["b"].groupby(m1.cumsum()).cummin()
- m1.cumsum()：这一步是关键。m1 中的 True 值会被视为 1，False 视为 0。cumsum() 会计算这些 0 和 1 的累积和。当 m1 遇到一个 True 时，累积和会增加 1，从而创建一个新的组 ID。
- 例如，如果 m1 是 [F, F, T, F, T]，那么 m1.cumsum() 将是 [0, 0, 1, 1, 2]。
- df["b"].groupby(m1.cumsum())：根据 m1.cumsum() 生成的组 ID 对 b 列进行分组。
- .cummin()：在每个分组内部独立地计算 b 的累积最小值。这有效地实现了“条件性重置”的累积最小值，即每当 m1 为 True 时，累积最小值就会重新开始计算。
示例 cm 值的生成：
```
m1        m1.cumsum()  b       cm (分组cummin)
False     0            100     100
False     0            103     100
False     0            101     100
False     0            105     100
True      1            110     110
False     1            120     110
False     1            101     101
False     1            150     101
False     1            160     101
```
m2 = (df["b"].le(cm) | df["a"].shift().le(cm.shift()))
- m2 是一个最终的布尔掩码，用于决定 c 列的每个值应该从 cm 中取，还是从一个独立的、基于 b 的 cummin 中取。
- 它由两个条件通过逻辑或 (|) 组合而成：
  - df["b"].le(cm)：当前 b 值是否小于或等于 cm 值。如果为真，意味着 b 仍在当前 cm 序列的范围内。
  - df["a"].shift().le(cm.shift())：a 的前一个值是否小于或等于 cm 的前一个值。如果为真，表示前一个状态仍然符合累积最小值的逻辑。
- 当 m2 为 True 时，表示 cm 中的值是有效的，可以作为 c 的值。
- 当 m2 为 False 时，表示 cm 中的值不再有效（例如，当前 b 值远大于 cm，或者前一个 a 值相对于前一个 cm 值过大），此时需要启动一个新的 cummin 序列，其起始值就是当前的 b。
示例 m2 值的生成：
```
b    cm   b<=cm  a_s  cm_s  a_s<=cm_s  m2 (b<=cm | a_s<=cm_s)
100  100  True   NaN  NaN   False      True
103  100  False  98   100   True       True
101  100  False  97   100   True       True
105  100  False  100  100   True       True
110  110  True   135  100   False      True
120  110  False  103  110   True       True
101  101  True   100  110   True       True
150  101  False  105  101   False      False  # b(150)>cm(101) 且 a_s(105)>cm_s(101)
160  101  False  109  101   False      False  # b(160)>cm(101) 且 a_s(109)>cm_s(101)
```
df["c"] = cm.where(m2, df["b"].mask(m2).cummin())
- 这是最终 c 列的构造步骤。
- cm.where(m2, ...)：where 函数根据布尔条件 m2 来选择值。
  - 如果 m2 为 True，则 c 的值取自 cm。
  - 如果 m2 为 False，则 c 的值取自 where 函数的第二个参数。
- df["b"].mask(m2)：

相关专题

Sass和less的区别

Sass和less的区别有语法差异、变量和混合器的定义方式、导入方式、运算符的支持、扩展性等。本专题为大家提供Sass和less相关的文章、下载、课程内容，供大家免费下载体验。

200

2023.10.12

Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧，涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估，以及基于实际业务场景的时间序列项目实操，帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

数据分析的方法

数据分析的方法有：对比分析法，分组分析法，预测分析法，漏斗分析法，AB测试分析法，象限分析法，公式拆解法，可行域分析法，二八分析法，假设性分析法。php中文网为大家带来了数据分析的相关知识、以及相关文章等内容。

463

2023.07.04

数据分析方法有哪几种

数据分析方法有：1、描述性统计分析；2、探索性数据分析；3、假设检验；4、回归分析；5、聚类分析。本专题为大家提供数据分析方法的相关的文章、下载、课程内容，供大家免费下载体验。

276

2023.08.07

网站建设功能有哪些

网站建设功能包括信息发布、内容管理、用户管理、搜索引擎优化、网站安全、数据分析、网站推广、响应式设计、社交媒体整合和电子商务等功能。这些功能可以帮助网站管理员创建一个具有吸引力、可用性和商业价值的网站，实现网站的目标。

724

2023.10.16

数据分析网站推荐

数据分析网站推荐：1、商业数据分析论坛；2、人大经济论坛-计量经济学与统计区；3、中国统计论坛；4、数据挖掘学习交流论坛；5、数据分析论坛；6、网站数据分析；7、数据分析；8、数据挖掘研究院；9、S-PLUS、R统计论坛。想了解更多数据分析的相关内容，可以阅读本专题下面的文章。

502

2024.03.13

Python 数据分析处理

本专题聚焦 Python 在数据分析领域的应用，系统讲解 Pandas、NumPy 的数据清洗、处理、分析与统计方法，并结合数据可视化、销售分析、科研数据处理等实战案例，帮助学员掌握使用 Python 高效进行数据分析与决策支持的核心技能。

2025.09.08

Python 数据分析与可视化

本专题聚焦 Python 在数据分析与可视化领域的核心应用，系统讲解数据清洗、数据统计、Pandas 数据操作、NumPy 数组处理、Matplotlib 与 Seaborn 可视化技巧等内容。通过实战案例（如销售数据分析、用户行为可视化、趋势图与热力图绘制），帮助学习者掌握从原始数据到可视化报告的完整分析能力。

2025.10.14

php与html混编教程大全

本专题整合了php和html混编相关教程，阅读专题下面的文章了解更多详细内容。

2026.01.13

热门下载

网站特效

网站源码

网站素材

前端模板