OpenMath-Nemotron— 英伟达开源的数学推理系列模型-人工智能-PHP中文网

OpenMath-Nemotron— 英伟达开源的数学推理系列模型

霞舞

发布： 2025-04-27 15:00:14

原创

1160人浏览过

openmath-nemotron是由英伟达推出的一系列开源数学推理模型，专门用于解决从基础到奥林匹克级别的复杂数学问题。这些模型通过大规模数据集openmathreasoning进行训练，该数据集包含54万个独特问题和320万个长推理解决方案。openmath-nemotron系列包括openmath-nemotron-1.5b、openmath-nemotron-7b、openmath-nemotron-14b、openmath-nemotron-32b以及openmath-nemotron-14b-kaggle（在aimo-2竞赛中使用的模型）。值得注意的是，1.5b版本在某些任务中表现超过了14b的deepseek-r1模型。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

OpenMath-Nemotron— 英伟达开源的数学推理系列模型 OpenMath-Nemotron的主要功能包括：

解决复杂数学问题：能够处理从基础到奥林匹克级别的数学难题。
长推理能力：通过逐步思考生成详细的解题步骤。
多模式推理：支持多种推理方式，以适应不同类型的数学问题。

OpenMath-Nemotron的技术原理基于以下几个方面：

大规模数据集：利用包含54万个独特数学问题及320万个长推理解决方案的OpenMathReasoning数据集进行训练。这些数据来自Art of Problem Solving（AoPS）社区论坛，经过严格筛选和处理。
长推理（Chain-of-Thought, CoT）：模型通过生成一系列中间解题步骤逐步推理出问题的解决方案，支持在生成最终答案前进行深入思考。
工具集成推理（Tool-Integrated Reasoning, TIR）：通过迭代训练、生成和质量过滤，将代码执行与长推理集成。模型在需要时提示代码进行计算，并在沙箱中执行代码，以获得更准确的解决方案。
模型训练与优化：使用监督微调（SFT）技术对Qwen2.5-Base模型进行训练，支持多种任务，包括CoT解决方案生成、TIR解决方案生成和GenSelect。采用AdamW优化器和余弦学习率衰减策略，结合序列打包和上下文并行化技术，显著加速长推理数据的训练。
推理优化：基于TensorRT-LLM进行模型推理优化，支持动态批量处理和多种量化技术，如int8和FP8，提高推理速度并减少延迟。

OpenMath-Nemotron的项目地址包括：