首页站长资讯AlphaGo核心算法增强，7B模型数学能力直逼GPT-4，阿里大模型新研究火了

AlphaGo核心算法增强，7B模型数学能力直逼GPT-4，阿里大模型新研究火了

站长网2024-05-09 20:26:187阅

把AlphaGo的核心算法用在大模型上，“高考”成绩直接提升了20多分。

在MATH数据集上，甚至让7B模型得分超过了GPT-4。

一项来自阿里的新研究引发关注:

研究人员用蒙特卡洛树搜索（MCTS）给大语言模型来了把性能增强，无需人工标注解题步骤，也能生成高质量数据，有效提升大模型的数学成绩。

论文发布，让不少网友重新关注到了蒙特卡洛树搜索这个在前大模型时代的明星算法。

有人直言:

蒙特卡洛树搜索 LLM是通往超级智能之路。

因为“树搜索本身更接近人类思维”。

用蒙特卡洛树搜索增强大模型

具体来说，阿里的研究人员提出了一种名为AlphaMath的方法，用大语言模型 MCTS来自动生成数学推理数据，并提升大模型在完成数学推理任务时的性能表现。

嗯，名字就很有蒙特卡洛树搜索内味儿了。

这里有个前情提要:

思维链（CoT）、思维程序(PoT)等方法已经被证明能够有效提高大模型的数学能力，但问题在于，它们都需要人类手动喂详细的解题步骤，即训练当中需要用到人工标注的高质量数学推理数据。

AlphaMath的一个核心目的就在于，在这个步骤中去人工化——数据格式就是简单的数学问题-答案对。

AlphaMath的技术路线主要涵盖三个阶段:

首先，研究人员收集了一个数学数据集，其中包含数学问题及其对应的正确答案。

然后，利用预训练的大模型（即策略模型）根据问题生成初始的解题路径，并通过MCTS对解题路径进行探索和改进，搜索更优的解题思路。

在MCTS过程中，同时训练一个价值模型来预测解题路径的质量，引导搜索方向。

最后，第二阶段获得的数据会被用来优化策略模型和价值模型。

这三个阶段会通过迭代优化地方式执行，以实现无需人工标注的自动数据生成和模型数学能力优化。

另外，研究人员还基于价值模型提出了Step-level Beam Search方法，以提高大模型的数学推理效率，平衡推理时的解题质量和运行时间。

简单来说，Step-level Beam Search是将MCTS推理过程做了个简化:

利用价值模型对候选路径进行评估，以更准确地选择高质量的解题路径。

通过逐步扩展和剪枝，在搜索过程中动态调整候选路径集合，提高搜索效率。

搜索过程中考虑了完整的解题路径，而不仅仅是局部的下一步动作，可以得到更全局优化的解题方案。

MATH成绩超GPT-4

为了验证AlphaMath的效果，研究人员设计了这样的实验:

对开源的数学大模型DeepSeekMath-Base-7B，用AlphaMath方法进行训练，并在GSM8K、MATH和Gaokao2023基准上，与GPT-4为代表的闭源模型、Llama2为代表的开源模型，以及专门做过数学SFT的MathCoder等模型进行对比。

结果显示，不依赖于人类（或GPT-4）标注的高质量数据，AlphaMath调教下的7B数学大模型，已经能在MATH上取得63%的分数，超过了GPT-4原版的42.5%和外挂代码解释器版的51.8%。

另外，在执行3轮MCTS并训练策略模型和价值模型的情况下，AlphaMath能让大模型在涵盖小学数学题的GSM8K上提升10多分，在MATH和Gaokao2023上提升20多分。

还可以看到，Step-level Beam Search在MATH数据集上取得了良好的效率和准确率平衡。

论文的共同一作是Guoxin Chen、Mingpeng liao、Chengxi Li和Kai Fan。

通讯作者Kai Fan本硕毕业于北京大学，2017年从杜克大学博士毕业，2018年加入阿里巴巴达摩院。

论文地址:

https://arxiv.org/abs/2405.03553

AlphaGo核心算法增强7B模型数学能力直逼GPT4 阿里大模型新研究火了

0007

评论列表

共(0)条

相关推荐

站长资讯
陶哲轩：初学者不宜用AI工具做专家级任务，GPT对专家帮助不大
近几个月来，著名数学家陶哲轩一直尝试用ChatGPT等大模型AI工具来辅助解决数学问题，并与大家分享结果、交流心得，比如用ChatGPT写代码、证明数学定理、生成LaTeX表达式程序代码等。对于自己的研究以及人们来说，GPT等AI工具的作用究竟大不大呢?近两天，陶哲轩似乎得出了他的结论。
站长网2023-09-11 09:13:33
0000
站长资讯
微软Windows 11开始菜单大改版！全部应用一页显示、推荐项可彻底关闭
快科技4月6日消息，根据最新消息，微软正在对Windows11的开始菜单进行重大改版，这一更新将彻底改变其布局和功能。Windows11的开始菜单将从现有的多栏布局改为单栏可滚动视图，所有固定图标和已安装应用都将集中在一页上显示，用户无需再点击全部应用”按钮即可浏览所有应用。此次更新最受用户欢迎的改进之一，是可以彻底关闭推荐项”功能。
站长网2025-04-07 09:04:35
0001
站长资讯
Anthropic任命Instagram联合创始人为首席产品官，拓展企业生成式AI服务
划重点:🔹Instagram联合创始人MikeKrieger被任命为Anthropic首席产品官🔹Anthropic是一家生成式AI创业公司，推出了Claude团队订阅计划🔹Krieger将负责开发和管理新产品，帮助Anthropic拓展企业级生成式AI应用
站长网2024-05-16 10:11:25
0002
站长资讯
LeCun发文质疑LLM推理能力大模型涌现离不开上下文学习
要点:LeCun认为，大语言模型（LLM）缺乏规划推理能力，其涌现能力主要源自上下文学习而非真正的推理。研究表明，针对复杂规划任务，如国际规划大赛中的问题，LLM的性能较差，其推理能力在特定领域受限，而涌现能力主要体现在简单任务和事先知道答案的情境中。
站长网2023-11-24 18:05:53
0000
站长资讯
次果生意：电商平台上为什么难以买到好水果？｜界面315
几年前，家住四川眉山的飞哥因家中的土地无人打理，他便返乡种起了柑橘。靠着这20亩地，他每年都能收获6万斤柑橘，其中有粑粑柑、不知火、爱媛等近年的网红品种。
站长网2023-05-25 05:04:01
0001