ChildMandarin— 智源联合南开开源的低幼儿童中文语音数据集-人工智能-PHP中文网

ChildMandarin— 智源联合南开开源的低幼儿童中文语音数据集

霞舞

发布： 2025-04-09 10:44:10

原创

820人浏览过

childmandarin：专为3-5岁儿童打造的普通话语音数据集

智源研究院与南开大学计算机学院人类语言技术实验室（HLT Lab）联合推出ChildMandarin，这是一个针对3-5岁儿童普通话语音的大型数据集。它包含来自中国22个省份的397名儿童的41.25小时高质量语音数据，数据采集过程模拟真实自然对话场景，确保数据真实可靠，并平衡了性别分布。ChildMandarin的发布填补了低幼儿童语音数据领域的空白，将有力推动儿童语音识别、语言发展研究以及智能语音交互系统的发展。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

ChildMandarin— 智源联合南开开源的低幼儿童中文语音数据集

ChildMandarin的核心应用：

提升儿童语音识别技术： ChildMandarin为自动语音识别 (ASR) 模型提供海量训练数据，显著提升模型对3-5岁儿童语音的识别准确率和鲁棒性。
儿童说话人识别： 该数据集支持说话人验证 (SV) 任务，有助于开发能够准确识别和区分不同儿童声音的系统，应用于儿童身份认证等场景。
儿童语言发展研究： ChildMandarin为儿童语言学研究提供宝贵的数据资源，有助于开发更有效的儿童语言学习工具和互动教育系统。

ChildMandarin的技术细节：

数据采集采用家长引导式对话，模拟自然交流，并使用智能手机（Android和iOS）进行录音，确保16kHz采样率和16位精度的高质量音频。专业人员对数据进行人工标注，包括发音、停顿、重复等语言现象，并记录说话人的年龄、性别、籍贯、录音设备和口音等级等元数据。模型训练和评估采用多种先进的ASR模型（如Transformer、Conformer、Paraformer）和技术（如CTC、AED、RNN-T），并对预训练模型（如HuBERT、Whisper）进行微调。说话人验证则采用说话人嵌入提取模型（如x-vector、ECAPA-TDNN、ResNet-TDNN）。数据集被划分为训练集、验证集和测试集，确保模型评估的科学性和有效性。