研究发现,GPT 和其他 AI 模型无法分析 SEC 备案文件
划重点:
- 📌 大型语言模型在分析 SEC 备案文件方面存在困难,常常无法正确回答问题。
- 📌 AI 模型经常会产生虚构的数字和事实,或者拒绝回答问题。
- 📌 AI 模型的性能必须更高才能在金融等受监管行业的大公司中实际应用。
一家名为 Patronus AI 的初创公司的研究人员发现,大型语言模型在分析美国证券交易委员会(SEC)备案文件时经常无法正确回答问题。即使是表现最佳的人工智能模型配置 OpenAI 的 GPT-4-Turbo,当给予几乎整个备案文件的阅读能力和相关问题时,仅有79% 的问题回答正确。Patronus AI 的创始人告诉 CNBC,这些所谓的大型语言模型有时会拒绝回答问题,或者会 “产生幻觉”,出现备案文件中不存在的数字和事实。
Patronus AI 的联合创始人 Anand Kannappan 表示:“这种性能水平完全不能接受。要想实现自动化和投入生产使用,性能必须更高。” 这些发现凸显了 AI 模型在大公司中应用的一些挑战,尤其是在金融等受监管行业。这些公司希望将先进技术应用于客户服务或研究,但 AI 模型面临一些困难。
图源备注:图片由AI生成,图片授权服务商Midjourney
快速提取重要数字并对财务陈述进行分析被认为是聊天机器人最有前景的应用之一,自去年底发布 ChatGPT 以来一直备受关注。SEC 备案文件中充满着重要的数据,如果一个机器人能够准确地概括这些文件或快速回答相关问题,它可以使用户在竞争激烈的金融行业中占据优势。
在过去的一年里,彭博社开发了自己的金融数据 AI 模型,商学院教授研究了 ChatGPT 是否可以解析财经头条新闻,摩根大通正在开发一个基于 AI 的自动投资工具。根据 CNBC 之前的报道,生成式 AI 预计每年可以为银行业带来数万亿美元的收益。
然而,GPT 进入该行业并不顺利。微软首次推出使用 OpenAI 的 GPT 的必应聊天时,其主要示例之一是使用聊天机器人快速概述盈利新闻稿。观察人员很快就意识到微软示例中的数字是错误的,一些数字完全是虚构的。
Patronus AI 的联合创始人表示,将大型语言模型应用于实际产品的挑战之一是,它们是非确定性的,不能保证每次给出相同的输出。这意味着公司需要进行更严格的测试,以确保它们的模型运行正确,不会偏离主题,并提供可靠的结果。
该公司的创始人在 Facebook 的母公司 Meta 公司相识,他们在该公司从事与理解模型生成答案的问题以及使其更加 “负责任” 方面的 AI 问题。他们成立了 Patronus AI,该公司已从 Lightspeed Venture Partners 获得种子资金,旨在通过软件实现对大型语言模型的自动化测试,以便公司可以确保其 AI 机器人不会以离题或错误的答案令客户或员工感到惊讶。
Patronus AI 致力于编写一套由主要上市公司的 SEC 备案文件中提取的10,000多个问题和答案,该数据集被称为 FinanceBench。数据集包括正确答案,以及在任何给定备案文件中准确查找答案的位置。并非所有答案都可以直接从文本中提取,有些问题需要轻微的数学或推理。
Patronus AI 测试了四个语言模型:OpenAI 的 GPT-4和 GPT-4-Turbo,Anthropic 的 Claude2和 Meta 的 Llama2,使用该公司生成的150个问题的子集进行测试。他们还测试了不同的配置和提示方式,例如将 OpenAI 模型在问题中给出与答案相关的确切源文本的 “Oracle” 模式。在其他测试中,模型被告知底层 SEC 文件存储的位置,或者在提示中包含 “长上下文”,即几乎完整的 SEC 备案文件与问题一起提供。
GPT-4-Turbo 在该公司的 “闭卷” 测试中失败,该测试不允许其访问任何 SEC 源文件。它在被问到的150个问题中,未能回答88% 的问题,只有14次给出了正确答案。当获得对底层备案文件的访问权限时,其性能有了显著改善。在 “Oracle” 模式下,GPT-4-Turbo 在85% 的情况下正确回答问题,但仍然在15% 的情况下给出了错误答案。然而,这种测试方式并不现实,因为它需要人工输入以找到备案文件中确切的相关位置,而这正是许多人希望语言模型能够解决的问题。
Meta 开发的开源 AI 模型 Llama2在获得各种底层文件的访问权限时,产生了一些最糟糕的 “幻觉”,错误回答的比例高达70%,仅有19% 的回答正确。Anthropic 的 Claude2在提供 “长上下文” 的情况下表现良好,可以回答75% 的问题,21% 的回答错误,仅有3% 的问题未能回答。GPT-4-Turbo 在长上下文测试中表现也不错,79% 的问题回答正确,17% 的回答错误。
在进行测试后,Patronus AI 的创始人对模型的表现感到惊讶,即使在指导答案所在位置的情况下,它们的表现仍然很差。“即使答案在上下文中,模型拒绝回答的频率也非常高,而人类是可以回答的。”Qian 说道。然而,即使模型表现良好,仍然不够好,Patronus AI 发现。“即使模型在20次中回答错误1次,这个错误率对于受监管的行业来说仍然不可接受。”Qian 说道。
然而,Patronus AI 的创始人认为,像 GPT 这样的语言模型在金融行业中有巨大的潜力,无论是分析师还是投资者,如果 AI 技术继续改进。“我们确实认为结果可能非常有希望。”Kannappan 表示,“随着时间的推移,模型将会变得更好。我们非常有希望在长期内,很多工作可以实现自动化。但是现在,你肯定需要至少一个人参与来支持和引导你的工作流程。”
公域持续获得流量的核心框架
各位村民好,我是村长想要做私域,就一定要学会从公域中获取流量。大家以为在公域获取流量,就是发内容就行了。看起来好像很简单,但整个公域流量的获取是一个很全面的操作流程。今天村长就先和大家一起来分享,从公域持续引流的基本框架和流程。01先做定位从公域引流随便发发也是可以的,但是这种东一枪、西一炮的做法不长久。想要长久的从公域获取流量,就要做账号,做定位。0001暂停元宇宙、进军AI、复刻推特,Meta亏损两年终盈利
近日,互联网与社交媒体巨头Meta发布了2023年Q2季度财报。在连续两年的亏损后,Meta终于交出了一份不错的成绩单。站长网2023-08-04 11:11:270000极氪官微发蔚来宣传图 官方回应:小编手误
今天下午,极氪汽车官微发布了一篇宣传自家产品极氪007的文章,然而却意外闹出了一个乌龙事件。原本应该配图的极氪007轿车图片,却错误地使用了友商蔚来汽车的产品ET7。这一失误立即引起了网友们的热议。对于这一尴尬的情况,极氪汽车官方迅速做出了回应。极氪智能科技CMO关海涛首先为极氪小编解围,他发文表示:“大家给极氪小编一个理解吧!在一起,才是中国高端纯电!大家一起加电吧!”站长网2024-02-22 16:08:500000腾讯两大国民APP账号又打通了?QQ悄然支持微信登陆
快科技6月24日消息,腾讯旗下拥有两大国民级社交APP,一个是微信,一个是QQ,几乎是人人必装,早些年可以用QQ登陆微信,但是后来被取消了,现在又反过来了,登陆QQ账号可以用微信了。在QQ升级之后又多了一个功能,登陆界面除了QQ号、手机号、QID/邮箱号之外又多了一个登陆选择,那就是绑定微信号,也就是说可以用微信号登陆QQ。站长网2023-06-25 23:21:320000苹果最强标准版!iPhone 16摄像头布局敲定
快科技2月8日消息,爆料人在社交平台上曝光了iPhone16设计图,该机采用类似iPhoneX的竖排双摄设计语言。爆料人指出,iPhone16标准版之所以采用这样的设计,是为了能实现空间视频录制。众所周知,iPhone15Pro和iPhone15ProMax能够录制空间视频,用户能在VisionPro上以3D视频的形式观看iPhone15Pro系列录制的内容。站长网2024-02-08 15:20:480000