如何在 Pandas 中正确计算含 NaN 值的加权平均（自动忽略无效权重）

花韻仙語

发布时间：2025-12-31 13:07:33

705人浏览过

来源于php中文网

原创

如何在 Pandas 中正确计算含 NaN 值的加权平均（自动忽略无效权重）

本文详解如何在 pandas dataframe 中对含 nan 的数据进行加权平均计算，确保权重仅作用于非空值，并动态归一化——即分母为对应列中有效值的权重之和，而非全部权重总和。

在实际数据分析中，直接使用 df.mul(weights).sum() / weights.sum() 会错误地将 NaN 对应的权重纳入分母，导致结果偏差（如示例中第2行本应只用权重4参与计算，却仍被除以总权重14）。正确做法是：按元素级对齐掩码，使权重仅保留在非 NaN 数据位置，再分别求加权和与有效权重和。

✅ 正确实现步骤

构造布尔掩码：df.notna() 生成与 df 同形的布尔矩阵，标记每个位置是否为有效值；
屏蔽无效权重：用 .mul(s, axis=0) 将权重序列 s 沿行广播，并与掩码相乘，使 NaN 位置的权重变为 0；
计算分子与分母：
- 加权和 = df.mul(masked_weights).sum()（NaN × 0 = 0，不影响求和）；
- 有效权重和 = masked_weights.sum(axis=0)（每列只累加该列非 NaN 行的权重）；
逐列除法：使用 .div() 实现广播除法，得到每列的加权平均。

import pandas as pd
import numpy as np

# 构造示例数据
df = pd.DataFrame({
    1: [100, 150, 175],
    2: [200, 250, 275],
    3: [300, np.nan, 375]
}, index=[1, 2, 3])

s = pd.Series([3, 4, 7], index=[1, 2, 3])

# ✅ 关键代码：动态加权平均（忽略 NaN 对应权重）
weights_masked = df.notna().mul(s, axis=0)  # 形状同 df，NaN 位权重为 0
weighted_sum = df.mul(weights_masked).sum()   # 每列加权和
valid_weight_sum = weights_masked.sum(axis=0) # 每列有效权重和
result = weighted_sum.div(valid_weight_sum)

print(result.round(6))

输出：

sematic

一个开源的机器学习平台

下载

1    151.785714
2    251.785714
3    352.500000
dtype: float64

⚠️ 注意事项

权重 s 的索引必须与 df.index 完全一致，否则 .mul(axis=0) 会因对齐失败导致意外 NaN 或广播错误；
若某列全为 NaN，则 valid_weight_sum 为 0，除法将返回 inf 或 NaN，建议前置检查：if (valid_weight_sum == 0).any(): raise ValueError("Empty column detected")；
该方法天然支持多列并行计算，无需循环，性能高效，适用于大规模数据场景。

此方案真正实现了「按需加权」：每一列独立计算其有效样本的加权均值，是处理缺失值加权统计的健壮范式。

Python构建毕业设计级AI项目的高质量实现方式【教程】

Python在AI项目中的特征工程构建全步骤讲解【技巧】

可视化从零到精通模型部署的实践方法【教程】

Python搭建AI问答系统的模型训练与应用方案【指导】

Python如何构建稳定可扩展的AI模型推理服务系统【教学】

相关标签:

ai pandas if 循环 raise column 数据分析

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：如何使用 CCXT 在 Bybit 上开平仓做空（Short）头寸下一篇：Pandas GroupBy多列聚合后广播结果回原始行的正确方法

作者最新文章

1599元起！闪极发布首款多合一移动硬盘闪盘Pro：最高1000MB/s、自带拓展坞

2025-12-30 13:39

Angular 中使用条件类绑定实现多状态样式控制（在线/离线/故障）

2025-12-30 13:39

如何根据下拉选项动态显示或隐藏城市标签

2025-12-30 13:41

如何在 Django 模板中正确处理空列表并避免渲染异常？

2025-12-30 13:47

《寂静岭》制作人：目标是每年都发售一部《寂静岭》游戏

2025-12-30 13:50

明年发售？《刺客信条：代号女巫》创意总监称26年将公布大量内容

2025-12-30 13:55

Go 中自定义结构体的可读性格式化：实现 Stringer 接口实现优雅输出

2025-12-30 14:00

PHP 中 else 后误用条件表达式导致的语法错误解析与修复

2025-12-30 14:04

如何在 Bootstrap 折叠组件中单次点击即加载 NGL 3D 分子可视化

2025-12-30 14:04

R星前总监力挺拉瑞安：不做《博德之门4》值得尊重！

2025-12-30 14:07

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI大模型

开放平台

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI大模型

通义千问

阿里巴巴推出的全能AI助手

AI大模型

腾讯元宝

腾讯混元平台推出的AI助手

文档处理

Excel 表格

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI大模型

中文写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

中文写作

写作工具

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接

图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI大模型

中文写作

智谱清言 - 免费全能的AI助手

AI大模型

PDF 文档

相关专题

Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧，涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估，以及基于实际业务场景的时间序列项目实操，帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

if什么意思

if的意思是“如果”的条件。它是一个用于引导条件语句的关键词，用于根据特定条件的真假情况来执行不同的代码块。本专题提供if什么意思的相关文章，供大家免费阅读。

711

2023.08.22

数据分析的方法

数据分析的方法有：对比分析法，分组分析法，预测分析法，漏斗分析法，AB测试分析法，象限分析法，公式拆解法，可行域分析法，二八分析法，假设性分析法。php中文网为大家带来了数据分析的相关知识、以及相关文章等内容。

450

2023.07.04

数据分析方法有哪几种

数据分析方法有：1、描述性统计分析；2、探索性数据分析；3、假设检验；4、回归分析；5、聚类分析。本专题为大家提供数据分析方法的相关的文章、下载、课程内容，供大家免费下载体验。

264

2023.08.07

网站建设功能有哪些

网站建设功能包括信息发布、内容管理、用户管理、搜索引擎优化、网站安全、数据分析、网站推广、响应式设计、社交媒体整合和电子商务等功能。这些功能可以帮助网站管理员创建一个具有吸引力、可用性和商业价值的网站，实现网站的目标。

718

2023.10.16

数据分析网站推荐

数据分析网站推荐：1、商业数据分析论坛；2、人大经济论坛-计量经济学与统计区；3、中国统计论坛；4、数据挖掘学习交流论坛；5、数据分析论坛；6、网站数据分析；7、数据分析；8、数据挖掘研究院；9、S-PLUS、R统计论坛。想了解更多数据分析的相关内容，可以阅读本专题下面的文章。

499

2024.03.13

Python 数据分析处理

本专题聚焦 Python 在数据分析领域的应用，系统讲解 Pandas、NumPy 的数据清洗、处理、分析与统计方法，并结合数据可视化、销售分析、科研数据处理等实战案例，帮助学员掌握使用 Python 高效进行数据分析与决策支持的核心技能。

2025.09.08

Python 数据分析与可视化

本专题聚焦 Python 在数据分析与可视化领域的核心应用，系统讲解数据清洗、数据统计、Pandas 数据操作、NumPy 数组处理、Matplotlib 与 Seaborn 可视化技巧等内容。通过实战案例（如销售数据分析、用户行为可视化、趋势图与热力图绘制），帮助学习者掌握从原始数据到可视化报告的完整分析能力。

2025.10.14