谷歌提出全新RLHF方法:消除奖励模型,且无需对抗性训练
效果更稳定,实现更简单。
大型语言模型(LLM)的成功离不开「基于人类反馈的强化学习(RLHF)」。RLHF 可以大致可以分为两个阶段,首先,给定一对偏好和不偏好的行为,训练一个奖励模型,通过分类目标为前者分配更高的分数。然后通过某种强化学习算法优化这个奖励函数。然而,奖励模型的关键要素可能会产生一些不良影响。
来自卡内基梅隆大学(CMU)和 Google Research 的研究者联合提出了一种简单的、理论上严格的、实验上有效的 RLHF 新方法 —— 自我博弈偏好优化(Self-Play Preference Optimization,SPO)。该方法消除了奖励模型,并且不需要对抗性训练。
论文:A Minimaximalist Approach to Reinforcement Learning from Human Feedback
论文地址:https://arxiv.org/abs/2401.04056
方法简介
SPO 方法主要包括两个方面。首先,该研究通过将 RLHF 构建为两者零和博弈(zero-sum game),真正消除了奖励模型,从而更有能力处理实践中经常出现的噪声、非马尔可夫偏好。其次,通过利用博弈的对称性,该研究证明可以简单地以自我博弈的方式训练单个智能体,从而消除了不稳定对抗训练的需要。
实际上,这相当于从智能体中采样多个轨迹,要求评估者或偏好模型比较每对轨迹,并将奖励设置为轨迹的获胜率。
SPO 避免了奖励建模、复合 error 和对抗性训练。通过从社会选择理论(social choice theory)中建立最小最大获胜者的概念,该研究将 RLHF 构建为两者零和博弈,并利用该博弈支付矩阵的对称性来证明可以简单地训练单个智能体来对抗其自身。
该研究还分析了 SPO 的收敛特性,并证明在潜在奖励函数确实存在的情况下,SPO 能以与标准方法相媲美的快速速度收敛到最优策略。
实验
该研究在一系列具有现实偏好函数的连续控制任务上,证明了 SPO 比基于奖励模型的方法性能更好。SPO 在各种偏好设置中能够比基于奖励模型的方法更有效地学习样本,如下图2所示。
该研究从多个维度将 SPO 与迭代奖励建模 (RM) 方法进行比较,旨在回答4个问题:
当面 intransitive 偏好时,SPO 能否计算 MW?
在具有独特 Copeland Winners / 最优策略的问题上,SPO 能否匹配或超过 RM 样本效率?
SPO 对随机偏好的稳健性如何?
SPO 可以处理非马尔可夫偏好吗?
在最大奖励偏好、噪声偏好、非马尔可夫偏好方面,该研究的实验结果分别如下图6、7、8所示:
感兴趣的读者可以阅读论文原文,了解更多研究内容。
图像识别更准确!尤洋团队研究:全新自适应计算模型AdaTape
【新智元导读】谷歌最新提出的自适应计算模型,能够提升图像识别性能。自适应计算(adaptivecomputation)是指ML统根据环境变化调整其行为的能力。传统神经网络具有固定的功能和计算能力,即用相同数量的FLOP来处理不同的输入。但具有自适应和动态计算的模型,根据输入的复杂性调节其专用于处理每个输入的计算预算。神经网络中的自适应计算之所以吸引人,有两个关键原因。站长网2023-08-24 16:31:240001一句话不说就爆卖250万元?原始人也逃不过直播带货!
起猛了,看到原始人也来做直播带货了!不是cos,不是表演,是正儿八经的、来自印度尼西亚巴布亚原始部落的土著野人,也曾被称为“食人族”。据说其祖辈有“吃人”风俗,当然如今这一习俗已消失。将原始人带到直播间的,是全网粉丝超千万的探险博主“李忆(探险家)”。站长网2024-09-30 20:54:040000苹果AI首秀市值蒸发4200亿:还带崩了供应商
快科技6月11日消息,在2024年全球开发者大会上,苹果终于推出了传闻已久的AppleIntelligence(苹果智能),与OpenAI的合作也正式官宣。但令苹果万万没想到的是,其在AI领域的首秀并未能赢得市场喝彩,反而导致自家市值大幅缩水,连带影响了供应商的股价。截至美东时间6月10日收盘,苹果股价下跌近2%,市值蒸发578亿美元(约合人民币4193亿元),再次跌破3万亿美元大关。站长网2024-06-12 08:39:450000游戏时光 VGtime 编辑全员离职 或将彻底停运
近日,游戏网站VGtime游戏时光发布公告称,最后三名编辑被开除。根据VGtime官方微博发布的消息,编辑部的最后三名编辑于上周五被资方开除,VGtime的整个团队,包括创始成员在内的所有编辑,也已经主动或者被动地离职。VGtime表示,这次悲剧的导火索是资方试图在网站引入自动抓取脚本,降低成本,以代替编辑们多年来对原创内容的追求。然而,编辑部对此发起了反对,这导致了双方的矛盾激化。站长网2023-04-24 09:42:480001从BBS到LOFTER:中文同人圈的奇幻二十年
影视剧的配角“上桌”潮,似乎从2023年一直延续到了现在。《长月烬明》里的陈都灵,《我的人间烟火》里的魏大勋,《花间令》中的郑合惠子……内娱大舞台摆好桌子,主角配角们来来去去,观众们的注意力也随之聚散,粉丝将之视为心头大患,番位斗争开始隐秘进行。站长网2024-06-27 14:34:520000