0

0

标题:使用 Pandas 对非数值尺寸列进行有序插值以填充缺失的线性空间值

花韻仙語

花韻仙語

发布时间:2026-01-18 09:22:14

|

808人浏览过

|

来源于php中文网

原创

标题:使用 Pandas 对非数值尺寸列进行有序插值以填充缺失的线性空间值

本文介绍如何基于商品组(如 shoes、shirt)内已知的最小/最大尺寸顺序,对 length、width、height、volume 等连续型字段进行线性插值填充,支持混合型尺寸(如 's'/'m' 和 '1'/'2'),并具备面向新 skugroup 的可扩展性。

在电商或仓储系统中,SKU 尺寸常以非数值形式(如 's', 'xl', '3xl')或数值形式(如 '1', '5')表示,而其对应物理属性(长、宽、高、体积)往往呈近似线性关系。当部分 SKU 的这些属性缺失时,若简单用均值或前向填充,会破坏尺寸-属性间的单调性;更优解是按尺寸语义顺序进行线性插值——即先定义尺寸的逻辑序,再在该序下对数值列做等距映射。

核心思路是:将 size 列转换为 有序分类类型(CategoricalDtype),使其支持 sort_values() 和 interpolate() 的天然协同。Pandas 的 interpolate() 在分组后对排序数据调用时,会自动基于索引位置(即尺寸顺序)执行线性插值,完美替代手动 np.linspace() + 手动对齐的易错逻辑。

以下为完整、可扩展的实现方案:

Figstack
Figstack

一个基于 Web 的AI代码伴侣工具,可以帮助跨不同编程语言管理和解释代码。

下载
import pandas as pd
import numpy as np

# 示例数据(含 NaN)
data_wm = {
    'sku': [6124, 7343, 7981, 5761, 1570, 7223, 4107, 8187, 4653, 1802, 4079],
    'skugroup': ['shoes', 'shoes', 'shoes', 'shoes', 'shoes', 'shoes', 'shirt', 'shirt', 'shirt', 'shirt', 'shirt'],
    'size': ['s', 'm', 'l', 'xl', '2xl', '3xl', '1', '2', '3', '4', '5'],
    'length': [1.5, np.nan, np.nan, np.nan, np.nan, 6, 1, np.nan, np.nan, np.nan, 4],
    'width': [2, np.nan, np.nan, np.nan, np.nan, 8, 2, np.nan, np.nan, np.nan, 5],
    'height': [2, np.nan, np.nan, np.nan, np.nan, 3, 3, np.nan, np.nan, np.nan, 6],
    'volume': [6, np.nan, np.nan, np.nan, np.nan, 144, 6, np.nan, np.nan, np.nan, 120]
}
df = pd.DataFrame(data_wm)

# ✅ 定义全局尺寸顺序(支持未来新增 skugroup,如 'pants': ['28', '29', ..., '42'])
txt_sizes = ['xs', 's', 'm', 'l', 'xl', '2xl', '3xl', '4xl', '5xl']
num_sizes = [str(i) for i in range(1, 21)]  # 覆盖常见数字尺寸
all_sizes = txt_sizes + num_sizes

# 创建有序分类类型(关键!)
size_dtype = pd.CategoricalDtype(all_sizes, ordered=True)

# ✅ 核心处理:按 skugroup 分组 → 按 size 排序 → 对数值列插值
numeric_cols = ['length', 'width', 'height', 'volume']
df[numeric_cols] = (
    df.astype({'size': size_dtype})           # 强制转换为有序分类
      .sort_values(['skugroup', 'size'])     # 先按组、再按尺寸顺序排序
      .groupby('skugroup', sort=False)[numeric_cols]
      .apply(lambda x: x.interpolate(method='linear'))  # 组内线性插值
      .reset_index(drop=True)                 # 保持原始索引对齐(重要!)
      .reindex(df.index)                      # 确保结果与原 df 行序一致
)

print(df.round(2))
✅ 输出说明:shoes 组中 's'→'3xl' 共 6 个尺寸,length 从 1.5 线性增至 6.0,步长 0.9;shirt 组 '1'→'5' 同理,volume 从 6 增至 120,严格满足线性关系。

关键优势与注意事项:

  • 可扩展性强:只需在 all_sizes 列表中追加新尺寸(如 'xxs', '6', 'waist32'),无需修改主逻辑;新增 skugroup(如 'pants')会自动被 groupby 处理。
  • 健壮性高:interpolate() 自动跳过首尾 NaN(仅对中间缺失值插值),且不依赖 fillna() 的索引对齐风险。
  • 避免陷阱
    • ❌ 不要直接对 size 字符串排序('10'
    • ❌ 不要手动 np.linspace() 后用 fillna() —— 易因索引错位导致值填到错误行;
    • ✅ 务必使用 reset_index(drop=True) + reindex() 保证插值结果严格落回原始位置。

此方法将“尺寸语义顺序”与“物理属性线性变化”解耦建模,是处理多品类 SKU 尺寸映射问题的工业级实践方案。

相关专题

更多
Python 时间序列分析与预测
Python 时间序列分析与预测

本专题专注讲解 Python 在时间序列数据处理与预测建模中的实战技巧,涵盖时间索引处理、周期性与趋势分解、平稳性检测、ARIMA/SARIMA 模型构建、预测误差评估,以及基于实际业务场景的时间序列项目实操,帮助学习者掌握从数据预处理到模型预测的完整时序分析能力。

51

2025.12.04

js 字符串转数组
js 字符串转数组

js字符串转数组的方法:1、使用“split()”方法;2、使用“Array.from()”方法;3、使用for循环遍历;4、使用“Array.split()”方法。本专题为大家提供js字符串转数组的相关的文章、下载、课程内容,供大家免费下载体验。

258

2023.08.03

js截取字符串的方法
js截取字符串的方法

js截取字符串的方法有substring()方法、substr()方法、slice()方法、split()方法和slice()方法。本专题为大家提供字符串相关的文章、下载、课程内容,供大家免费下载体验。

208

2023.09.04

java基础知识汇总
java基础知识汇总

java基础知识有Java的历史和特点、Java的开发环境、Java的基本数据类型、变量和常量、运算符和表达式、控制语句、数组和字符串等等知识点。想要知道更多关于java基础知识的朋友,请阅读本专题下面的的有关文章,欢迎大家来php中文网学习。

1465

2023.10.24

字符串介绍
字符串介绍

字符串是一种数据类型,它可以是任何文本,包括字母、数字、符号等。字符串可以由不同的字符组成,例如空格、标点符号、数字等。在编程中,字符串通常用引号括起来,如单引号、双引号或反引号。想了解更多字符串的相关内容,可以阅读本专题下面的文章。

619

2023.11.24

java读取文件转成字符串的方法
java读取文件转成字符串的方法

Java8引入了新的文件I/O API,使用java.nio.file.Files类读取文件内容更加方便。对于较旧版本的Java,可以使用java.io.FileReader和java.io.BufferedReader来读取文件。在这些方法中,你需要将文件路径替换为你的实际文件路径,并且可能需要处理可能的IOException异常。想了解更多java的相关内容,可以阅读本专题下面的文章。

550

2024.03.22

php中定义字符串的方式
php中定义字符串的方式

php中定义字符串的方式:单引号;双引号;heredoc语法等等。想了解更多字符串的相关内容,可以阅读本专题下面的文章。

545

2024.04.29

go语言字符串相关教程
go语言字符串相关教程

本专题整合了go语言字符串相关教程,阅读专题下面的文章了解更多详细内容。

162

2025.07.29

高德地图升级方法汇总
高德地图升级方法汇总

本专题整合了高德地图升级相关教程,阅读专题下面的文章了解更多详细内容。

43

2026.01.16

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Go 教程
Go 教程

共32课时 | 3.9万人学习

Go语言实战之 GraphQL
Go语言实战之 GraphQL

共10课时 | 0.8万人学习

关于我们 免责申明 举报中心 意见反馈 讲师合作 广告合作 最新更新
php中文网:公益在线php培训,帮助PHP学习者快速成长!
关注服务号 技术交流群
PHP中文网订阅号
每天精选资源文章推送

Copyright 2014-2026 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号