发布几小时,微软秒删媲美GPT-4开源大模型!竟因忘记投毒测试
【新智元导读】前段时间,微软公布并开源了最新一代大模型WizardLM-2,号称性能堪比GPT-4。不过,还未上线一天,模型权重和公告全被删除了,原因竟是......
上周,微软空降了一个堪称GPT-4级别的开源模型WizardLM-2。
却没想到发布几小时之后,立马被删除了。
有网友突然发现,WizardLM的模型权重、公告帖子全部被删除,并且不再微软集合中,除了提到站点之外,却找不到任何证据证明这个微软的官方项目。
GitHub项目主页已成404。
项目地址:https://wizardlm.github.io/
包括模型在HF上的权重,也全部消失了.....
全网满脸疑惑,WizardLM怎么没了?
然鹅,微软之所以这么做,是因为团队内部忘记对模型做「测试」。
随后,微软团队现身道歉并解释道,自几个月前WizardLM发布以来有一段时间,所以我们对现在新的发布流程不太熟悉。
我们不小心遗漏了模型发布流程中所需的一项内容 :投毒测试
微软WizardLM升级二代
去年6月,基于LlaMA微调而来的初代WizardLM一经发布,吸引了开源社区一大波关注。
论文地址:https://arxiv.org/pdf/2304.12244.pdf
随后,代码版的WizardCoder诞生——一个基于Code Llama,利用Evol-Instruct微调的模型。
测试结果显示,WizardCoder在HumanEval上的pass@1达到了惊人的73.2%,超越了原始GPT-4。
时间推进到4月15日,微软开发者官宣了新一代WizardLM,这一次是从Mixtral8x22B微调而来。
它包含了三个参数版本,分别是8x22B、70B和7B。
最值得一提的是,在MT-Bench基准测试中,新模型取得了领先的优势。
具体来说,最大参数版本的WizardLM8x22B模型性能,几乎接近GPT-4和Claude3。
在相同参数规模下,70B版本位列第一。
而7B版本是最快的,甚至可以达到与,参数规模10倍大的领先模型相当的性能。
WizardLM2出色表现的背后的秘诀在于,微软开发的革命性训练方法论Evol-Instruct。
Evol-Instruct利用大型语言模型,迭代地将初始指令集改写成越来越复杂的变体。然后,利用这些演化指令数据对基础模型进行微调,从而显著提高其处理复杂任务的能力。
另一个是强化学习框架RLEIF,也在WizardLM2开发过程中起到了重要作用。
在WizardLM2训练中,还采用了AI Align AI(AAA)方法,可以让多个领先的大模型相互指导和改进。
AAA框架由两个主要的组件组成,分别是「共同教学」和「自学」。
共同教学这一阶段,WizardLM和各种获得许可的开源和专有先进模型进行模拟聊天、质量评判、改进建议和缩小技能差距。
通过相互交流和提供反馈,模型可向同行学习并完善自身能力。
对于自学,WizardLM可通过主动自学,为监督学习生成新的进化训练数据,为强化学习生成偏好数据。
这种自学机制允许模型通过学习自身生成的数据和反馈信息来不断提高性能。
另外,WizardLM2模型的训练使用了生成的合成数据。
在研究人员看来,大模型的训练数据日益枯竭,相信AI精心创建的数据和AI逐步监督的模型将是通往更强大人工智能的唯一途径。
因此,他们创建了一个完全由AI驱动的合成训练系统来改进WizardLM-2。
手快的网友,已经下载了权重
然而,在资料库被删除之前,许多人已经下载了模型权重。
在该模型被删除之前,几个用户还在一些额外的基准上进行了测试。
好在测试的网友对7B模型感到印象深刻,并称这将是自己执行本地助理任务的首选模型。
还有人对其进行了投毒测试,发现WizardLM-8x22B的得分为98.33,而基础Mixtral-8x22B的得分为89.46,Mixtral8x7B-Indict的得分为92.93。
得分越高越好,也就是说WizardLM-8x22B还是很强的。
如果没有投毒测试,将模型发出来是万万不可的。
大模型容易产生幻觉,人尽皆知。
如果WizardLM2在回答中输出「有毒、有偏见、不正确」的内容,对大模型来说并不友好。
尤其是,这些错误引来全网关注,对与微软自身来说也会陷入非议之中,甚至会被当局调查。
有网友疑惑道,你可以通过「投毒测试」更新指标。为什么要删除整个版本库和权重?
微软作者表示,根据内部最新的规定,只能这样操作。
还有人表示,我们就想要未经「脑叶切除」的模型。
不过,开发者们还需要耐心等待,微软团队承诺,会在测试完成后重新上线。
参考资料:
https://favtutor.com/articles/wizardlm-2-benchmarks/
https://anakin.ai/blog/wizardlm-2-microsoft/
老款iPhone遭淘汰!中国移动App宣布最低兼容iOS 11
快科技7月3日消息,日前,中国移动发布最低系统兼容版本升级公告,称中国移动App最低兼容版本将从iOS9调整至iOS11。为保证使用体验,官方建议用户尽快升级iOS系统至iOS11及以上版本。由于机型原因,iPhone5c、iPhone5、iPhone4s机型的用户目前不支持升级至iOS11及以上版本,因此用户后续将无法升级至最新APP版本,可能导致无法享受更好的服务。站长网2024-07-03 10:53:050000ChatGPT 和 GPT-4 均无法通过成为 CFA 所需的所有级别的考试
站长之家(ChinaZ.com)11月3日消息:根据最近的一项研究,ChatGPT未能通过特许金融分析师(CFA)考试——这是许多华尔街金融专业人士的基准资格。这项研究由摩根大通的AI研究团队和大学学者联合进行,他们使用CFA风格的问题测试了ChatGPT和GPT-4(两款由OpenAI创建的大型语言模型)是否具备复杂的财务推理能力。站长网2023-11-03 15:04:110002360一季度净亏损1.86亿元 称全力布局人工智能大模型
三六零发布年年度报告摘要称,2022年实现营业收入95.21亿元,同比下降12.54%;净亏损22.04亿元,上年同期净利润9.02亿元。2023年一季度实现营业收入约19.66亿元,净利润-1.86亿元,主要由于公司全力布局人工智能大模型,人力、设备等支出大幅增长所致。站长网2023-04-22 07:20:420000京东物流与淘天集团达成合作 将全面接入淘宝和天猫平台
京东物流近日宣布与淘天集团达成合作协议,将全面接入淘宝和天猫平台,为这两个平台的商家提供物流服务。双方的系统对接已基本完成,众多商家已经开始使用京东物流,同时消费者也能在淘宝和天猫的APP内查询到京东物流的轨迹。0000董明珠再回应玫瑰空调被吐槽:独一无二 玫瑰空调是最棒的
今日,董明珠在直播中再次回应了关于玫瑰空调的争议。她表示,格力电器是第一个创造出玫瑰空调的品牌,即便有人认为其存在缺陷,但无可否认的是,玫瑰空调依然是最棒的,因为至今没有第二家能够复制这样的设计,这本身就是一种创新和创造。站长网2024-05-15 08:59:570000