大模型幻觉率排行：GPT-4 3%最低，谷歌Palm竟然高达27.2%

站长网2023-11-15 18:08:590阅

排行榜一出，高下立见。

人工智能发展进步神速，但问题频出。OpenAI 新出的GPT 视觉 API 前脚让人感叹效果极好，后脚又因幻觉问题令人不禁吐槽。

幻觉一直是大模型的致命缺陷。由于数据集庞杂，其中难免会有过时、错误的信息，导致输出质量面临着严峻的考验。过多重复的信息还会使大模型形成偏见，这也是幻觉的一种。但是幻觉并非无解命题。开发过程中对数据集慎重使用、严格过滤，构建高质量数据集，以及优化模型结构、训练方式都能在一定程度上缓解幻觉问题。

流行的大模型有那么多，它们对于幻觉的缓解效果如何?这里有个排行榜明确地对比了它们的差距。

该排行榜由专注于 AI 的 Vectara 平台发布。排行榜更新于2023年11月1日，Vectara 表示后续会随着模型的更新继续跟进幻觉评估。

项目地址:https://github.com/vectara/hallucination-leaderboard

为了确定这个排行榜，Vectara 使用各种开源数据集对摘要模型进行了事实一致性研究，并训练了一个模型来检测 LLM 输出中的幻觉。他们使用了一个媲美 SOTA 模型，然后通过公共 API 向上述每个 LLM 输送了1000篇简短文档，并要求它们仅使用文档中呈现的事实对每篇文档进行总结。在这1000篇文档中，只有831篇文档被每个模型总结，其余文档由于内容限制被至少一个模型拒绝回答。利用这831份文件，Vectara 计算了每个模型的总体准确率和幻觉率。每个模型拒绝响应 prompt 的比率详见「Answer Rate」一栏。发送给模型的内容都不包含非法或不安全内容，但其中的触发词足以触发某些内容过滤器。这些文件主要来自 CNN / 每日邮报语料库。

需要注意的是，Vectara 评估的是摘要准确性，而不是整体事实准确性。这样可以比较模型对所提供信息的响应。换句话说，评估的是输出摘要是否与源文件「事实一致」。由于不知道每个 LLM 是在什么数据上训练的，因此对于任何特别问题来说，确定幻觉都是不可能的。此外，要建立一个能够在没有参考源的情况下确定回答是否是幻觉的模型，就需要解决幻觉问题，而且需要训练一个与被评估的 LLM 一样大或更大的模型。因此，Vectara 选择在总结任务中查看幻觉率，因为这样的类比可以很好地确定模型整体真实性。

检测幻觉模型地址:https://huggingface.co/vectara/hallucination_evaluation_model

此外，LLM 越来越多地用于 RAG（Retrieval Augmented Generation，检索增强生成）管道来回答用户的查询，例如 Bing Chat 和谷歌聊天集成。在 RAG 系统中，模型被部署为搜索结果的汇总器，因此该排行榜也是衡量模型在 RAG 系统中使用时准确性的良好指标。

由于 GPT-4一贯的优秀表现，它的幻觉率最低似乎是意料之中的。但是有网友表示，GPT-3.5与 GPT-4并没有非常大的差距是令他较为惊讶的。

LLaMA2紧追 GPT-4与 GPT-3.5之后，有着较好的表现。但谷歌大模型的表现实在不尽人意。有网友表示，谷歌 BARD 常用「我还在训练中」来搪塞它的错误答案。

有了这样的排行榜，能够让我们对于不同模型之间的优劣有更加直观的判断。前几天，OpenAI 推出了 GPT-4Turbo，这不，立刻有网友提议将其也更新在排行榜中。

下次的排行榜会是怎样的，有没有大幅变动，我们拭目以待。

参考链接:

https://twitter.com/bindureddy/status/1724152343732859392

https://twitter.com/vectara/status/1721943596692070486

大模型幻觉率排行GPT4 3 最低 谷歌Palm竟然高达272

0000

评论列表

共(0)条

相关推荐

站长资讯
ChatGPT只讲这25个笑话，实验上千次有90%重复，网友：幽默是人类最后的尊严
如果你试过让ChatGPT随便讲个笑话（英语），那你大概率见过这个:两位德国学者对GPT3.5做了个大型测试，发现它其实只会讲25个笑话。1008次结果中有90%都是25个笑话的变体，只是稍微改变一下措辞或句式。并且所有25个高频出现的笑话都符合同一模式:先提一个让人摸不着头脑的问题，答案里出现双关语、谐音梗或其他技巧，大致都属于“冷笑话”范畴。
站长网2023-06-12 22:57:17
0000
站长资讯
Pika推出Lip Sync功能支持视频人物嘴部动画和音频同步
创新视频生成工具Pika最近推出了一项名为LipSync的新功能。这项功能旨在帮助用户在生成视频中实现嘴部动画和音频的同步，从而提供更加生动和逼真的视频体验。该功能目前仅PikaPro用户可以体验，PikaPro用户订阅费为每月58美元。
站长网2024-02-28 10:23:27
0000
站长资讯
为什么要拆分王朝/海洋APP？比亚迪官方回复来了
8月31日，比亚迪王朝/海洋APP、小程序正式拆分独立运营。王朝车主前往比亚迪王朝APP，海洋车主前往比亚迪海洋APP，王朝海洋共有车主及未进行车主认证的用户可自行选择。关于大家最关心的问题：为什么要拆分APP？比亚迪也给出了答案：为了给车主们提供更精细化的客户服务。
站长网2023-09-02 15:26:05
0000
播客的时运：从小众到“每一年都是元年”
01一个老播客迷的播客往事其实，我是一个老播客听众了，如果当年musicradio那些节目也被算作为播客的话。中学时代，我就是边听musicradio边做题。那时候网络欠发达，还用小灵通，很多新歌首发都在音乐之声。那时候的广播节目，有资源，有市场影响力。但不同于美国这个车轮上的国家，中国的收音机这个媒介，几乎从来没有真正意义上成为过大众媒介。
站长网站长资讯2025-01-07 09:21:06
0000
站长资讯
五一出门，信大众点评还是信小红书？
五一出门旅游，如果你在做攻略时，遭到搭子连续否定，别急着与对方battle，可能是你俩参考的平台不同。如今，人们出游做攻略时，经常会在美食、美景的选择上，分成“大众点评党”和“小红书党”，两派在各自平台浏览后，推荐的往往大相径庭。“大众点评党”与“小红书党”，之所以推荐画风不同，似乎因为平台用户画像差异，以及平台功能的区别。
站长网2024-04-29 17:14:59
0000