首页站长资讯专用于手机、笔记本，Stability.ai开源ChatGPT基因的大模型

专用于手机、笔记本，Stability.ai开源ChatGPT基因的大模型

站长网2023-12-09 09:35:480阅

12月8日，著名开源生成式AI平台stability.ai在官网开源了，30亿参数的大语言模型StableLM Zephyr3B。

Zephyr3B专用于手机、笔记本等移动设备，主打参数小、性能强、算力消耗低的特点，可自动生成文本、总结摘要等，可与70亿、130亿参数的模型相媲美。

值得一提的是，该模型的核心架构来自Zephyr7B，并进行了精调。而Zephyr7B是基于前几天刚获35亿元巨额融资Mistral AI的Mistral-7B模型微调而成。

同时使用了GPT-3.5生成了训练数据集以及GPT-4对其进行了人工智能反馈，所以，Zephyr3B是有多家大厂模型基因的超级缝合怪。

Zephyr3B开源地址:https://huggingface.co/stabilityai/stablelm-zephyr-3b

Zephyr7B开源地址:https://huggingface.co/HuggingFaceH4/zephyr-7b-beta

由于Stability.ai并没有开放Zephyr3B的论文，只能从Zephyr7B的技术文档为大家解读一下其核心架构，主要包含监督学习优化、人工智能反馈和直觉优化指导学习三大模块。

由于该模型在训练数据集和人工智能反馈等方面使用了GPT系列模型，有很强的ChatGPT基因。

监督学习优化（dSFT）

研究人员通过OpenAI的GPT-3.5模型生成了规模庞大的对话数据集“UltraChat”，超过147万条多轮不同主题对话示例。

然后通过该数据集对模型进行监督学习优化，训练样本是对话内容和回复，以最大程度降低“交叉熵”误差。

该流程类似传统的监督学习方法，将模型训练任务指定到给定数据集上。

但与使用人工数据集略有不同，该方法直接使用了强大语言模型自主生成高质量的训练数据，避免了人工乱标注难题。

人工智能反馈（AIF）

为了进一步提升模型的文本生成、理解的精准度，研究人员使用了第二个数据集UltraFeedback，对4个不同的大语言模型，在不同主题下的回复进行打分评价。

具体方法是将每条对话的文本提示送入到4个模型，得到4个答案，然后再由“教师模型”GPT-4进行打分（0—10分）。最高分答案为“优先答案”，随机选择另一个作为“非优先答案”进行深度优化。

直觉优化指导学习（dDPO）

通过使用前面的“UltraFeedback”收集的GPT-4对话样本及质量评价，提取高分和低分样本作为数据配对组。

就是按批处理对优先和非优先样本计算两种概率，并利用损失函数测量它们的差异，通过反向传播优化模型参数。

该算法以试批方式运行，在每轮中随机选取样本对，计算当前模型与基线模型在这两个样本上的概率误差。

通过这种反向传播将误差回溯至参数，可实时地微调模型结构。整个优化流程非常高效，无需采样，几小时就能完成，并且不需任何人工标注。

测试数据

Stability.ai表示，Zephyr3B在MT Bench、AlpacaEval等平台进行了测试，在生成上下文相关、连贯和语言准确等文本方面的表现非常优秀。

特别擅长创意、个性化文本生成，同时能根据用户输入的数据进行分析。

其性能可与Falcon-4b-Instruct、WizardLM-13B-v1、Llama-2-70b-chat 和 Claude-V1等几个大参数模型相媲美。

专用于手机笔记本Stabilityai开源ChatGPT基因的大模型

0000

评论列表

共(0)条

相关推荐

站长资讯
GPT-4o mini背后团队揭秘：9人团华人面孔过半，清华北大同济校友在列
“大模型尺寸之争正在加速……倒退!”OpenAI的GPT-4omini一登场，又登上了大模型话题榜榜首。并且这次话题焦点，是OpenAI不仅再树新标杆，还一出手就把性价比卷爆了——直接把此前大受开发者好评的Gemini1.5Flash和Claude3Haiku给碾压了。这不，大神Karpathy火速发了篇小作文，做出开头提到的这么一句判断，并进一步解释:
站长网2024-07-20 00:50:41
0001
站长资讯
iPhone15或推迟上市时间可能延迟至4季度发布
据udn报道，美国消费电子大厂苹果上度季财报将在约两周后揭晓，华尔街已开始调整对苹果上季与之后的业绩预估，但至少一位分析师担心，近期的iPhone销售看来疲弱。
站长网2023-07-20 17:17:22
0000
站长资讯
滴滴再次就系统故障致歉:软件故障是事故起因非攻击造成
11月29日，滴滴出行就近日系统故障再次向用户致歉。滴滴称，初步调查发现，此次事故的起因是底层系统软件故障，并非外界传闻的遭到网络攻击。事故导致滴滴APP多个服务瘫痪，给用户带来不便。滴滴表示，技术团队正在开展风险排查和系统升级，以完全保障服务的稳定运行。公司将持续努力避免类似故障的再次发生。滴滴高层已深刻反思此事，以确保公司能提供更好的服务保障。以下为声明全文:再一次致歉
站长网2023-11-29 11:17:15
0000
站长资讯
Netflix开发新的AI技术实时替换视频背景，绿幕将成为过去时
Netflix的研究人员表示，他们可能已经让无处不在的绿幕过时了。MagantaGreenScreen（MGS）是一项在影视行业中应用人工智能的创新进展，它利用人工智能的力量增强视觉效果，使其在实时中更加逼真和精确。
站长网2023-07-12 12:11:28
0000
大厂年终奖折叠，差距在拉大
B站2024年度弹幕为“接”。“接”，代表着年轻人对美好事物的期待与渴望，例如考试上岸、入职升职、表白成功、欧气爆棚时，用户便会发出“接”字弹幕，以示“沾沾好运”。临近年终，互联网上网友们的普遍情绪是，“接”高额年终奖。在“降本增效”口号大喊三年之后的今天，互联网公司年终奖备受关注。有无年终奖、年终奖多少、年终奖何时发放，这些对于自称“牛马”的打工人来说至关重要。
站长网站长资讯2025-01-23 09:35:53
0000