如何在 Pandas 中实现自定义边界（含右闭区间）的数值分箱

聖光之護

发布时间：2026-01-27 09:11:09

576人浏览过

来源于php中文网

原创

如何在 Pandas 中实现自定义边界（含右闭区间）的数值分箱

本文介绍一种灵活处理非标准分箱需求的方法：使用 `pd.cut` 配合布尔掩码，将最后一个区间设为右闭区间（如 `[190, 200]`），解决 `pd.cut` 默认左闭右开导致 200 无法被包含的问题。

在数据分析中，pd.cut 是最常用的数值分箱工具，但它默认采用左闭右开区间（right=True）或左闭右开+左开右闭混合（right=False），无法直接支持混合闭合性——例如前四段为 [a, b)，最后一段却需为 [c, d]（右闭）。当你的业务逻辑明确要求包含端点值（如满分 200 必须归入最高档），就需要额外干预。

核心思路是：先用 pd.cut(..., right=False) 得到标准左闭右开结果，再通过布尔索引单独修正等于右端点的值。以下为完整实现：

import pandas as pd

# 示例数据：模拟 100.0 到 200.3 的浮点数序列（含精确的 200.0）
s = pd.Series(range(1000, 2004)).div(10)  # 100.0, 100.1, ..., 200.0, 200.1, ...

# 定义分箱边界（5 个区间 → 6 个断点）
bins = [100, 135, 160, 175, 190, 200]
labels = ['[100, 135)', '[135, 160)', '[160, 175)', '[175, 190)', '[190, 200]']

# 第一步：常规左闭右开分箱（注意 right=False → [a, b)）
cut_result = pd.cut(s, bins=bins, labels=labels, right=False)

# 第二步：定位所有等于 200 的元素，并将其标签强制替换为 '[190, 200]'
cond = s == 200.0
out = cut_result.mask(cond, '[190, 200]')

print(out.iloc[998:1003])  # 查看关键位置

输出中可验证：

数说Social Research

社媒领域的AI Agent，全能营销智能助手

下载

s.iloc[999] == 199.9 → 归入 [190, 200]（因 199.9 ∈ [190, 200) 成立）
s.iloc[1000] == 200.0 → 显式覆盖为 [190, 200]，满足业务要求
s.iloc[1001] == 200.1 → 超出最大边界，结果为 NaN（符合预期）

⚠️ 注意事项：

mask() 会将满足条件的位置替换为指定值，原 cut_result 中对应位置的类别需与新值兼容（此处 '[190, 200]' 已在 labels 中定义，故可安全注入）；
若数据中存在 200.0 以外的 200（如整数 200），建议统一转换为浮点或使用 s.round(1).eq(200.0) 增强鲁棒性；
此法适用于任意“仅末端闭合”的场景，只需修改 cond 和替换值即可迁移。

总结：pd.cut 本身不支持混合区间闭合性，但借助向量化布尔操作，我们能以极小代价实现精准控制——既保持代码简洁，又确保业务语义无损。

如何检测当前 Python 是否运行在 Nuitka 编译的可执行文件中

Python 函数签名设计与可读性原则

Python 如何写出可测试的函数

Python 内存分析工具 tracemalloc 实战

Django-CKEditor-5 全功能工具栏配置完整指南

相关标签:

工具 pandas 数据分析数据分析

本站声明：本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

上一篇：Tkinter Grid 布局中控件重叠与层级控制完全指南下一篇：暂无

作者最新文章

HTML2PDF.js 在 iOS 设备上生成空白 PDF 的解决方案

2026-01-24 10:09

如何禁用 VS Code 中 HTML 类名显示为 “...” 的折叠行为

2026-01-24 10:11

如何在网页中持久化保存图片点赞数（无需后端数据库）

2026-01-24 10:14

长达17分钟！《仁王3》最新实机游玩影片发布

2026-01-24 10:24

如何使用 Pandas 将多符号时序数据高效分文件追加保存为 CSV

2026-01-24 10:24

如何为多个实例正确实现 HTML 悬停式 Kebab 菜单

2026-01-24 10:27

如何在 Go 中正确匹配带转义引号的 MySQL ENUM 字符串

2026-01-24 10:29

铸就你的传奇：中世纪锻剑模拟游戏《铸剑吟》今日开启抢先体验

2026-01-24 10:29

标题：如何在表单末尾按回车键自动添加一行新输入行并聚焦首个字段

2026-01-24 10:29

Go 语言的垃圾回收机制由谁执行？

2026-01-24 10:38

热门AI工具

DeepSeek

幻方量化公司旗下的开源大模型平台

AI 编程开发 AI 聊天问答

豆包大模型

字节跳动自主研发的一系列大型语言模型

AI 编程开发 AI大模型

通义千问

阿里巴巴推出的全能AI助手

AI 编程开发 Agent智能体

腾讯元宝

腾讯混元平台推出的AI助手

文档处理 AI 聊天问答

文心一言

文心一言是百度开发的AI聊天机器人，通过对话可以生成各种形式的内容。

AI 编程开发 AI 文本写作

讯飞写作

基于讯飞星火大模型的AI写作工具，可以快速生成新闻稿件、品宣文案、工作总结、心得体会等各种文文稿

AI 文本写作中文写作

即梦AI

一站式AI创作平台，免费AI图片和视频生成。

图片拼接图画生成

ChatGPT

最最强大的AI聊天机器人程序，ChatGPT不单是聊天机器人，还能进行撰写邮件、视频脚本、文案、翻译、代码等任务。

AI 编程开发 AI 文本写作

智谱清言 - 免费全能的AI助手

AI 编程开发 Agent智能体

相关专题

Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧，涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估，以及基于实际业务场景的时间序列项目实操，帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

2025.12.04

数据分析的方法

数据分析的方法有：对比分析法，分组分析法，预测分析法，漏斗分析法，AB测试分析法，象限分析法，公式拆解法，可行域分析法，二八分析法，假设性分析法。php中文网为大家带来了数据分析的相关知识、以及相关文章等内容。

471

2023.07.04

数据分析方法有哪几种

数据分析方法有：1、描述性统计分析；2、探索性数据分析；3、假设检验；4、回归分析；5、聚类分析。本专题为大家提供数据分析方法的相关的文章、下载、课程内容，供大家免费下载体验。

280

2023.08.07

网站建设功能有哪些

网站建设功能包括信息发布、内容管理、用户管理、搜索引擎优化、网站安全、数据分析、网站推广、响应式设计、社交媒体整合和电子商务等功能。这些功能可以帮助网站管理员创建一个具有吸引力、可用性和商业价值的网站，实现网站的目标。

737

2023.10.16

数据分析网站推荐

数据分析网站推荐：1、商业数据分析论坛；2、人大经济论坛-计量经济学与统计区；3、中国统计论坛；4、数据挖掘学习交流论坛；5、数据分析论坛；6、网站数据分析；7、数据分析；8、数据挖掘研究院；9、S-PLUS、R统计论坛。想了解更多数据分析的相关内容，可以阅读本专题下面的文章。

513

2024.03.13

Python 数据分析处理

本专题聚焦 Python 在数据分析领域的应用，系统讲解 Pandas、NumPy 的数据清洗、处理、分析与统计方法，并结合数据可视化、销售分析、科研数据处理等实战案例，帮助学员掌握使用 Python 高效进行数据分析与决策支持的核心技能。

2025.09.08

Python 数据分析与可视化

本专题聚焦 Python 在数据分析与可视化领域的核心应用，系统讲解数据清洗、数据统计、Pandas 数据操作、NumPy 数组处理、Matplotlib 与 Seaborn 可视化技巧等内容。通过实战案例（如销售数据分析、用户行为可视化、趋势图与热力图绘制），帮助学习者掌握从原始数据到可视化报告的完整分析能力。

2025.10.14

数据分析的方法

471

2023.07.04