发布几小时,微软秒删媲美GPT-4开源大模型!竟因忘记投毒测试
【新智元导读】前段时间,微软公布并开源了最新一代大模型WizardLM-2,号称性能堪比GPT-4。不过,还未上线一天,模型权重和公告全被删除了,原因竟是......
上周,微软空降了一个堪称GPT-4级别的开源模型WizardLM-2。
却没想到发布几小时之后,立马被删除了。
有网友突然发现,WizardLM的模型权重、公告帖子全部被删除,并且不再微软集合中,除了提到站点之外,却找不到任何证据证明这个微软的官方项目。
GitHub项目主页已成404。
项目地址:https://wizardlm.github.io/
包括模型在HF上的权重,也全部消失了.....
全网满脸疑惑,WizardLM怎么没了?
然鹅,微软之所以这么做,是因为团队内部忘记对模型做「测试」。
随后,微软团队现身道歉并解释道,自几个月前WizardLM发布以来有一段时间,所以我们对现在新的发布流程不太熟悉。
我们不小心遗漏了模型发布流程中所需的一项内容 :投毒测试
微软WizardLM升级二代
去年6月,基于LlaMA微调而来的初代WizardLM一经发布,吸引了开源社区一大波关注。
论文地址:https://arxiv.org/pdf/2304.12244.pdf
随后,代码版的WizardCoder诞生——一个基于Code Llama,利用Evol-Instruct微调的模型。
测试结果显示,WizardCoder在HumanEval上的pass@1达到了惊人的73.2%,超越了原始GPT-4。
时间推进到4月15日,微软开发者官宣了新一代WizardLM,这一次是从Mixtral8x22B微调而来。
它包含了三个参数版本,分别是8x22B、70B和7B。
最值得一提的是,在MT-Bench基准测试中,新模型取得了领先的优势。
具体来说,最大参数版本的WizardLM8x22B模型性能,几乎接近GPT-4和Claude3。
在相同参数规模下,70B版本位列第一。
而7B版本是最快的,甚至可以达到与,参数规模10倍大的领先模型相当的性能。
WizardLM2出色表现的背后的秘诀在于,微软开发的革命性训练方法论Evol-Instruct。
Evol-Instruct利用大型语言模型,迭代地将初始指令集改写成越来越复杂的变体。然后,利用这些演化指令数据对基础模型进行微调,从而显著提高其处理复杂任务的能力。
另一个是强化学习框架RLEIF,也在WizardLM2开发过程中起到了重要作用。
在WizardLM2训练中,还采用了AI Align AI(AAA)方法,可以让多个领先的大模型相互指导和改进。
AAA框架由两个主要的组件组成,分别是「共同教学」和「自学」。
共同教学这一阶段,WizardLM和各种获得许可的开源和专有先进模型进行模拟聊天、质量评判、改进建议和缩小技能差距。
通过相互交流和提供反馈,模型可向同行学习并完善自身能力。
对于自学,WizardLM可通过主动自学,为监督学习生成新的进化训练数据,为强化学习生成偏好数据。
这种自学机制允许模型通过学习自身生成的数据和反馈信息来不断提高性能。
另外,WizardLM2模型的训练使用了生成的合成数据。
在研究人员看来,大模型的训练数据日益枯竭,相信AI精心创建的数据和AI逐步监督的模型将是通往更强大人工智能的唯一途径。
因此,他们创建了一个完全由AI驱动的合成训练系统来改进WizardLM-2。
手快的网友,已经下载了权重
然而,在资料库被删除之前,许多人已经下载了模型权重。
在该模型被删除之前,几个用户还在一些额外的基准上进行了测试。
好在测试的网友对7B模型感到印象深刻,并称这将是自己执行本地助理任务的首选模型。
还有人对其进行了投毒测试,发现WizardLM-8x22B的得分为98.33,而基础Mixtral-8x22B的得分为89.46,Mixtral8x7B-Indict的得分为92.93。
得分越高越好,也就是说WizardLM-8x22B还是很强的。
如果没有投毒测试,将模型发出来是万万不可的。
大模型容易产生幻觉,人尽皆知。
如果WizardLM2在回答中输出「有毒、有偏见、不正确」的内容,对大模型来说并不友好。
尤其是,这些错误引来全网关注,对与微软自身来说也会陷入非议之中,甚至会被当局调查。
有网友疑惑道,你可以通过「投毒测试」更新指标。为什么要删除整个版本库和权重?
微软作者表示,根据内部最新的规定,只能这样操作。
还有人表示,我们就想要未经「脑叶切除」的模型。
不过,开发者们还需要耐心等待,微软团队承诺,会在测试完成后重新上线。
参考资料:
https://favtutor.com/articles/wizardlm-2-benchmarks/
https://anakin.ai/blog/wizardlm-2-microsoft/
腾讯小世界将改名QQ短视频 强化短视频产品定位
据界面新闻报道,腾讯QQ的“小世界”产品将更名为“QQ短视频”,以进一步强化其短视频的产品定位。据报道,来自QQ内部的消息人士透露,目前在整个QQ平台上,有很多用户只观看短视频而不参与聊天。这意味着小世界在QQ的活跃用户数据中占据了相当大的比例,对于腾讯来说,这是一个值得关注和利用的资源。站长网2023-12-01 14:14:450000全网粉丝超4000万,“猫一杯”的互联网唠嗑记 | 新榜专访
靠唠嗑收获千万粉丝关注,是一种怎样的体验?“Thurman猫一杯”或许深有体会。从2020年4月发布第一条吐槽法国快递时效的视频开始,她几乎事无巨细地分享生活日常,吸引粉丝们与之互动,还诞生出多个花名。不管是她啃菜叶子的酷似程度被唤作“豚鼠”;还是她弄丢自己竖大拇指照片做屏保的手机,获得“广州白云机场大拇哥”的称号……这些片段在她的讲述中好笑又离谱,像是在听身边好友唠嗑聊八卦。站长网2024-01-22 14:11:250000读书郎将推出 AI 学习机或搭载梦想教育大模型
国内知名教育科技智能硬件品牌读书郎在其官方微博上发布了三张图片,并配以话题标签“读书郎梦想教育大模型”和“AI学习机”,此举可被视为读书郎公司即将开始研发自己的大模型的公开声明。站长网2023-09-13 09:18:490000更新iOS17后位置服务自动开启?苹果称正调查部分用户诉求
据外媒报道,苹果正在调查部分iPhone用户报告称,更新iOS17后,其重要位置服务和iPhone分析选项被自动打开的问题。据悉,这两项功能原本在用户的“设置”中是关闭状态,但在更新系统后变为打开,且无需警告或征得用户同意。尽管看似大多数用户未受影响,但仍有用户表示这一变化令人担忧,因为打开这两项功能会泄露用户位置信息。苹果方面已证实,用户原有隐私设置不应在更新后改变,正积极调查此事。站长网2023-09-25 14:22:110000AI游戏初创公司“奇酷网络”获得500万元融资
近日,奇酷网络宣布获得500万元融资,开启“AI游戏”新征程。这家成立仅三个月的公司以3,000万元人民币的估值成功吸引了一名百度高层和一位知名天使投资人的资金支持。0000