deepcoder-14b-preview:一款开源的140亿参数代码生成模型
Agentica和Together AI联合发布了DeepCoder-14B-Preview,这是一个基于Deepseek-R1-Distilled-Qwen-14B微调的大型代码生成模型。该模型采用分布式强化学习(RL)训练,在代码生成任务上表现优异,尤其在LiveCodeBench基准测试中取得了60.6%的准确率,与OpenAI的o3-mini模型不相上下。 更重要的是,其训练数据集、代码、训练日志和系统优化方案均已开源,旨在降低RL训练门槛,促进社区发展和强化学习在大型语言模型(LLM)领域的应用。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

核心功能:
技术架构:
DeepCoder-14B-Preview基于经过蒸馏优化的140亿参数预训练模型Deepseek-R1-Distilled-Qwen-14B,并通过分布式强化学习进行微调。其训练使用了24000个经过严格筛选的可验证编程问题,数据来源包括TACO Verified、PrimeIntellect的SYNTHETIC-1数据集以及LiveCodeBench。 模型采用稀疏结果奖励模型(ORM),仅在生成的代码通过所有采样单元测试时才给予奖励,避免模型依赖记忆测试用例。 此外,迭代上下文扩展技术和verl-pipeline流水线技术分别提升了模型的泛化能力和训练效率。
项目资源:
应用场景:
以上就是DeepCoder-14B-Preview— Agentica 联合 Together AI 开源的代码生成模型的详细内容,更多请关注php中文网其它相关文章!
                        
                        每个人都需要一台速度更快、更稳定的 PC。随着时间的推移,垃圾文件、旧注册表数据和不必要的后台进程会占用资源并降低性能。幸运的是,许多工具可以让 Windows 保持平稳运行。
                
                                
                                
                                
                                
                                
                                Copyright 2014-2025 https://www.php.cn/ All Rights Reserved | php.cn | 湘ICP备2023035733号