大模型幻觉率排行:GPT-4 3%最低,谷歌Palm竟然高达27.2%
排行榜一出,高下立见。
人工智能发展进步神速,但问题频出。OpenAI 新出的GPT 视觉 API 前脚让人感叹效果极好,后脚又因幻觉问题令人不禁吐槽。
幻觉一直是大模型的致命缺陷。由于数据集庞杂,其中难免会有过时、错误的信息,导致输出质量面临着严峻的考验。过多重复的信息还会使大模型形成偏见,这也是幻觉的一种。但是幻觉并非无解命题。开发过程中对数据集慎重使用、严格过滤,构建高质量数据集,以及优化模型结构、训练方式都能在一定程度上缓解幻觉问题。
流行的大模型有那么多,它们对于幻觉的缓解效果如何?这里有个排行榜明确地对比了它们的差距。
该排行榜由专注于 AI 的 Vectara 平台发布。排行榜更新于2023年11月1日,Vectara 表示后续会随着模型的更新继续跟进幻觉评估。
项目地址:https://github.com/vectara/hallucination-leaderboard
为了确定这个排行榜,Vectara 使用各种开源数据集对摘要模型进行了事实一致性研究,并训练了一个模型来检测 LLM 输出中的幻觉。他们使用了一个媲美 SOTA 模型,然后通过公共 API 向上述每个 LLM 输送了1000篇简短文档,并要求它们仅使用文档中呈现的事实对每篇文档进行总结。在这1000篇文档中,只有831篇文档被每个模型总结,其余文档由于内容限制被至少一个模型拒绝回答。利用这831份文件,Vectara 计算了每个模型的总体准确率和幻觉率。每个模型拒绝响应 prompt 的比率详见 「Answer Rate」一栏。发送给模型的内容都不包含非法或 不安全内容,但其中的触发词足以触发某些内容过滤器。这些文件主要来自 CNN / 每日邮报语料库。
需要注意的是,Vectara 评估的是摘要准确性,而不是整体事实准确性。这样可以比较模型对所提供信息的响应。换句话说,评估的是输出摘要是否与源文件「事实一致」。由于不知道每个 LLM 是在什么数据上训练的,因此对于任何特别问题来说,确定幻觉都是不可能的。此外,要建立一个能够在没有参考源的情况下确定回答是否是幻觉的模型,就需要解决幻觉问题,而且需要训练一个与被评估的 LLM 一样大或更大的模型。因此,Vectara 选择在总结任务中查看幻觉率,因为这样的类比可以很好地确定模型整体真实性。
检测幻觉模型地址:https://huggingface.co/vectara/hallucination_evaluation_model
此外,LLM 越来越多地用于 RAG(Retrieval Augmented Generation,检索增强生成)管道来回答用户的查询,例如 Bing Chat 和谷歌聊天集成。在 RAG 系统中,模型被部署为搜索结果的汇总器,因此该排行榜也是衡量模型在 RAG 系统中使用时准确性的良好指标。
由于 GPT-4一贯的优秀表现,它的幻觉率最低似乎是意料之中的。但是有网友表示,GPT-3.5与 GPT-4并没有非常大的差距是令他较为惊讶的。
LLaMA2紧追 GPT-4与 GPT-3.5之后,有着较好的表现。但谷歌大模型的表现实在不尽人意。有网友表示,谷歌 BARD 常用「我还在训练中」来搪塞它的错误答案。
有了这样的排行榜,能够让我们对于不同模型之间的优劣有更加直观的判断。前几天,OpenAI 推出了 GPT-4Turbo,这不,立刻有网友提议将其也更新在排行榜中。
下次的排行榜会是怎样的,有没有大幅变动,我们拭目以待。
参考链接:
https://twitter.com/bindureddy/status/1724152343732859392
https://twitter.com/vectara/status/1721943596692070486
微软推ZeRO++新系统:减少大模型训练时间和成本
微软研究人员推出了名为ZeRO的新系统,用于优化训练大型AI模型,以应对高数据传输开销和有限带宽的难题。ZeRO建立在现有的ZeRO优化的基础上,并提供增强的通信策略,以提高训练效率,减少训练时间和成本。站长网2023-06-27 16:04:000000腾讯、字节“世纪大和解”!《王者荣耀》抖音直播今起全面开放:禁播已5年
快科技1月21日消息,今天起,《王者荣耀》抖音直播全面开放,玩家们将再度在抖音观看到《王者荣耀》直播。近年来,腾讯和字节跳动因侵权问题纷争不断,《王者荣耀》于2019年在抖音全面禁播,距今近5年,本次复播意味着腾讯与字节跳动迎来世纪大和解”。据国内媒体报道,自2016年起,腾讯多次状告字节跳动,指控其旗下平台直播腾讯系游戏的行为侵犯了著作权。0000AI日报:智谱清言智能体中心上线AI老罗;英雄联盟现在可以用AI辅助了?面壁智能宣布MiniCPM 免费商用;英伟达推出对应Comfyui节点
欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。新鲜AI产品点击了解:https://top.aibase.com/1、智谱AI全模型矩阵降价清言智能体中心上线罗永浩“AI老罗”站长网2024-06-05 20:11:4500009.9买一套AI写真,秒鸭相机能火多久?
只要花9.9元就能有一套自己的数字分身和AI写真,这是最近比较火的一款图像类小程序——秒鸭相机。我在朋友圈、微信群中,都有看过一些朋友圈讨论、转发过这个产品,虽然火爆程度不如以前脸萌、ZAO等风靡一时。但作为图像类且收费的产品,还有这么多人愿意主动分享实属不易。01图像美化一直有机会我一直强调,围绕图像美化一直有机会,这其中包含图片、视频和音频。站长网2023-07-25 16:34:410000前CFO再发文声讨 宝宝树声明:该员工散播谣言以泄私愤
12月24日消息,近日,宝宝树前CFO徐翀曝出:复星集团对自己和团队非法限制人身自由、人身威胁及诬告陷害;并称复星集团扬言干扰司法,气焰嚣张至极;此外,徐翀表示,宝宝树集团仍欠自己2.1亿元人民币本金未归还,并造成自己大量额外损失。对此,宝宝树官方微博发布声明:0000