自我奖励下的大型模型：Llama2通过Meta学习自行优化，超越GPT-4的性能

PHPz

发布时间：2024-01-23 13:15:05

706人浏览过

来源于机器之心

转载

人工智能的反馈（aif）要代替 rlhf 了？

大模型领域中，微调是改进模型性能的重要一步。随着开源大模型逐渐变多，人们总结出了很多种微调方式，其中一些取得了很好的效果。

最近，来自 Meta、纽约大学的研究者用「自我奖励方法」，让大模型自己生成自己的微调数据，给人带来了一点新的震撼。

在新方法中，作者对 Llama 2 70B 进行了三个迭代的微调，生成的模型在 AlpacaEval 2.0 排行榜上优于一众现有重要大模型，包括 Claude 2、Gemini Pro 和 GPT-4。

因此，论文刚刚发上 arXiv 几个小时就引起了人们的注意。

虽然目前方法还没有开源，但是人们认为论文中使用的方法描述清晰，复现起来应该不难。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

大模型自我奖励：Meta让Llama2自己给自己微调，性能超越了GPT-4

众所周知，使用人类偏好数据调整大语言模型（LLM）可以极大提高预训练模型的指令跟踪性能。在 GPT 系列中，OpenAI 提出了人类反馈强化学习 (RLHF) 的标准方法，让大模型可以从人类偏好中学习奖励模型，再使得奖励模型被冻结并用于使用强化学习训练 LLM，这种方法已获得了巨大的成功。

最近出现的新思路是完全避免训练奖励模型，并直接使用人类偏好来训练 LLM，如直接偏好优化（DPO）。在以上两种情况下，调优都受到人类偏好数据的大小和质量的瓶颈，并且在 RLHF 的情况下，调优质量还受到从它们训练的冻结奖励模型的质量的瓶颈。

在 Meta 的新工作中，作者提议训练一个自我改进的奖励模型，该模型不是被冻结，而是在 LLM 调整期间不断更新，以避免这一瓶颈。

这种方法的关键是开发一个拥有训练期间所需的所有能力的智能体（而不是分为奖励模型和语言模型），让指令跟随任务的预训练和多任务训练允许通过同时训练多个任务来实现任务迁移。

因此作者引入了自我奖励语言模型，其智能体既充当遵循模型的指令，为给定的提示生成响应，也可以根据示例生成和评估新指令，以添加到他们自己的训练集中。

新方法使用类似于迭代 DPO 的框架来训练这些模型。从种子模型开始，如图 1 所示，在每次迭代中都有一个自指令创建过程，其中模型为新创建的提示生成候选响应，然后由同一模型分配奖励。后者是通过 LLM-as-a-Judge 的提示来实现的，这也可以看作是指令跟随任务。根据生成的数据构建偏好数据集，并通过 DPO 训练模型的下一次迭代。

大模型自我奖励：Meta让Llama2自己给自己微调，性能超越了GPT-4

论文标题：Self-Rewarding Language Models
论文链接：https://arxiv.org/abs/2401.10020

自我奖励的语言模型

作者提出的方法首先假设：可以访问基本的预训练语言模型和少量人工注释的种子数据，然后建立一个模型，旨在同时拥有两种技能：

1. 指令遵循：给出描述用户请求的提示，能够生成高质量、有帮助（且无害）的响应。

2. 自指令创建：能够按照示例生成和评估新指令以添加到自己的训练集中。

使用这些技能是为了使模型能够执行自对准，即它们是用于使用人工智能反馈（AIF）迭代训练自身的组件。

自指令的创建包括生成候选响应，然后让模型本身判断其质量，即它充当自己的奖励模型，从而取代对外部模型的需求。这是通过 LLM-as-a-Judge 机制实现的 [Zheng et al., 2023b]，即通过将响应评估制定为指令跟随任务。这个自行创建的 AIF 偏好数据被用作训练集。

所以在微调过程中，相同的模型被用于两个角色：作为「学习者」和作为「法官」。基于新出现的法官角色，模型可以通过上下文微调来进一步提升性能。

整体的自对齐过程是一个迭代过程，通过以下步骤来进行：构建一系列模型，每个模型都比上一个模型有所改进。在这其中重要的是，由于模型既可以提高其生成能力，又可以通过相同的生成机制作为自己的奖励模型，这意味着奖励模型本身可以通过这些迭代来改进，这就与奖励模型固有的标准做法出现了不同。

研究者认为，此种方式可以提高这些学习模型未来自我改进的潜力上限，消除限制性瓶颈。

图 1 展示了该方法的概述。

大模型自我奖励：Meta让Llama2自己给自己微调，性能超越了GPT-4

萝卜简历

免费在线AI简历制作工具，帮助求职者轻松完成简历制作。

下载

实验

在实验中，研究者使用了 Llama 2 70B 作为基础预训练模型。他们发现，与基线种子模型相比，自奖励 LLM 对齐不仅提高了指令跟随表现，奖励建模能力也得到了提高。

这意味着在迭代训练中，模型能够在给定的迭代中为自己提供比上一次迭代质量更好的偏好数据集。虽然这种影响在现实世界中会趋于饱和，但提供了一种有趣的可能：这样得到的奖励模型（以及 LLM）要优于仅从人类撰写的原始种子数据里训练的模型。

在指令跟随能力方面，实验结果如图 3 所示：

大模型自我奖励：Meta让Llama2自己给自己微调，性能超越了GPT-4 研究者在 AlpacaEval 2 排行榜上评估了自奖励模型，结果如表 1 所示。他们观察到了与 head-to-head 评估相同的结论，即训练迭代的胜率比 GPT4-Turbo 高，从迭代 1 的 9.94%，到迭代 2 的 15.38%，再到迭代 3 的 20.44%。同时，迭代 3 模型优于许多现有模型，包括 Claude 2、Gemini Pro 和 GPT4 0613。

大模型自我奖励：Meta让Llama2自己给自己微调，性能超越了GPT-4

奖励建模评估结果如表 2，结论包括：

EFT在SFT基线上有所改进，使用IFT+EFT与单独使用IFT相比，五个测量指标都有所提高。例如，与人类的成对准确率一致性从65.1%上升到78.7%。
通过自我训练提高奖励建模能力。进行一轮自我奖励训练后，模型为下一次迭代提供自我奖励的能力得到了提高，此外它的指令跟随能力也得到了提高。
LLMas-a-Judge 提示的重要性。研究者使用了各种提示格式发现，LLMas-a-Judge 提示在使用 SFT 基线时成对准确率更高。

作者认为，自我奖励的训练方式既提高了模型的指令跟踪能力，也提高了模型在迭代中的奖励建模能力。

虽然这只是一项初步研究，但看来已是一个令人兴奋的研究方向，此种模型能够更好地在未来的迭代中分配奖励，以改善指令遵循，实现一种良性循环。

这种方法也为更复杂的判断方法开辟了一定的可能性。例如，大模型可以通过搜索数据库来验证其答案的准确性，从而获得更准确和可靠的输出。

^{参考内容：}^{https://www.reddit.com/r/MachineLearning/comments/19atnu0/r_selfrewarding_language_models_meta_2024/}

Meta AI 免费视频生成：图像动画和视频创作终极指南

SAM 2：视频图像分割领域的重大突破与未来展望

WhatsApp Meta AI照片编辑终极指南：一键打造潮流照片

HubMeta终极指南：AI驱动的文献综述与Meta分析平台

Meta CSV Generator Pro：微图素材快速生成工具全解析

数码产品性能查询

该软件包括了市面上所有手机CPU，手机跑分情况，电脑CPU，电脑产品信息等等，方便需要大家查阅数码产品最新情况，了解产品特性，能够进行对比选择最具性价比的商品。

下载

相关专题

数据库三范式

数据库三范式是一种设计规范，用于规范化关系型数据库中的数据结构，它通过消除冗余数据、提高数据库性能和数据一致性，提供了一种有效的数据库设计方法。本专题提供数据库三范式相关的文章、下载和课程。

344

2023.06.29

如何删除数据库

删除数据库是指在MySQL中完全移除一个数据库及其所包含的所有数据和结构，作用包括：1、释放存储空间；2、确保数据的安全性；3、提高数据库的整体性能，加速查询和操作的执行速度。尽管删除数据库具有一些好处，但在执行任何删除操作之前，务必谨慎操作，并备份重要的数据。删除数据库将永久性地删除所有相关数据和结构，无法回滚。

2074

2023.08.14

vb怎么连接数据库

在VB中，连接数据库通常使用ADO（ActiveX 数据对象）或 DAO（Data Access Objects）这两个技术来实现：1、引入ADO库；2、创建ADO连接对象；3、配置连接字符串；4、打开连接；5、执行SQL语句；6、处理查询结果；7、关闭连接即可。

347

2023.08.31

MySQL恢复数据库

MySQL恢复数据库的方法有使用物理备份恢复、使用逻辑备份恢复、使用二进制日志恢复和使用数据库复制进行恢复等。本专题为大家提供MySQL数据库相关的文章、下载、课程内容，供大家免费下载体验。

253

2023.09.05

vb中怎么连接access数据库

vb中连接access数据库的步骤包括引用必要的命名空间、创建连接字符串、创建连接对象、打开连接、执行SQL语句和关闭连接。本专题为大家提供连接access数据库相关的文章、下载、课程内容，供大家免费下载体验。

322

2023.10.09

数据库对象名无效怎么解决

数据库对象名无效解决办法：1、检查使用的对象名是否正确，确保没有拼写错误；2、检查数据库中是否已存在具有相同名称的对象，如果是，请更改对象名为一个不同的名称，然后重新创建；3、确保在连接数据库时使用了正确的用户名、密码和数据库名称；4、尝试重启数据库服务，然后再次尝试创建或使用对象；5、尝试更新驱动程序，然后再次尝试创建或使用对象。

408

2023.10.16

vb连接access数据库的方法

vb连接access数据库方法：1、使用ADO连接，首先导入System.Data.OleDb模块，然后定义一个连接字符串，接着创建一个OleDbConnection对象并使用Open() 方法打开连接；2、使用DAO连接，首先导入 Microsoft.Jet.OLEDB模块，然后定义一个连接字符串，接着创建一个JetConnection对象并使用Open()方法打开连接即可。

391

2023.10.16

vb连接数据库的方法

vb连接数据库的方法有使用ADO对象库、使用OLEDB数据提供程序、使用ODBC数据源等。详细介绍：1、使用ADO对象库方法，ADO是一种用于访问数据库的COM组件，可以通过ADO连接数据库并执行SQL语句。可以使用ADODB.Connection对象来建立与数据库的连接，然后使用ADODB.Recordset对象来执行查询和操作数据；2、使用OLEDB数据提供程序方法等等。

219

2023.10.19