谷歌被打脸!Gemini Pro被证实和GPT3.5差距不大
要点:
在CMU的研究中,Gemini Pro被与GPT-3.5和Mistral8×7B进行了深入的比较,结果显示GPT-3.5在多个任务上几乎全面优于Gemini Pro,但差距不大。
通过测试任务包括基于知识的问答、通用推理、数学问题、代码生成等领域,Gemini Pro在某些任务上表现较差,但在特定任务中超越了GPT-3.5。
文章强调Gemini Pro是多模态的,通过视频、文本和图像训练,而GPT-3.5Turbo和GPT-4Turbo主要基于文本,Mixtral是开源竞争对手。
谷歌最新发布的Gemini Pro自发布以来备受瞩目,谷歌声称其优于GPT-3.5。然而,CMU的研究通过深入的实验对比,展示了GPT-3.5在多个任务上的全面优势。Gemini Pro虽然在某些任务上稍显不足,但整体表现与GPT-3.5相近,为大模型领域的竞争增添了新的火花。
论文地址:https://arxiv.org/pdf/2312.11444.pdf
研究涉及了基于知识的问答、通用推理、数学问题、代码生成等多个领域。在基于知识的问答任务中,Gemini Pro在一些子任务上落后于GPT-3.5,尤其在多选题答案输出中显示了一定的偏见。通用推理测试中,Gemini Pro的精度略低于GPT-3.5Turbo,尤其在处理较长、复杂问题时表现不佳,而GPT-4Turbo则表现更为稳健。
数学问题领域的测试包括小学数学基准、稳健推理能力、不同语言模式和问题类型等。Gemini Pro在某些任务上略显不足,特别是在多样化的语言模式任务中,表现较GPT-3.5Turbo稍逊。在代码生成方面,Gemini Pro在两项任务上的表现均低于GPT-3.5Turbo,与GPT-4Turbo相比则差距更大。
总体而言,Gemini Pro作为多模态模型,尽管在某些任务上稍显不足,但在特定领域表现出色,超越了GPT-3.5。然而,在大多数测试中,GPT-3.5Turbo仍然保持领先地位,证明其在开源模型中的卓越性能。这一研究为科技领域的大模型竞争提供了客观中立的第三方对比,为未来的模型发展提供了有益的参考。
印度科技巨头Wipro将投资10亿美元于人工智能领域 并为员工提供培训
印度软件服务提供商Wipro希望公司所有员工都掌握人工智能的使用。该公司于本周三宣布,将在未来三年内投资10亿美元来提升其人工智能能力,其中包括培训其全球66个国家、25万名员工。Wipro是印度最大的外包公司之一,专门提供IT和咨询服务。此举是在生成式人工智能(generativeAI)迅速崛起的背景下进行的。站长网2023-07-15 01:58:580000奥特曼此前遭解雇或因AI威胁人类
在不到一周的时间内,OpenAI的政变大戏经历了多次反转,最终以山姆·奥特曼重返OpenAI担任CEO而结束。有知情人士透露,在公司内部,有几名研究员联合向董事会提交了一封信。信中警告称,公司正在研发的人工智能(AI)技术可能对人类构成威胁。奥特曼是OpenAI内部积极推动生成式人工智能(AGI)的代表人物,而这个警告信似乎是他被解雇的关键因素。然而,具体信中内容尚未公开。站长网2023-11-23 11:13:520000AI已学会上网点外卖!HyperWrite发布AI智能体 可自主浏览网页并付款
又进阶!AI已经学会点外卖了!最近,外国小哥的创业公司HyperWrite,发布了一个尚处实验阶段的AI智能体。网站地址:https://www.hyperwriteai.com/HyperWrite的AI助手在设计上非常人性化,可以像人一样操作浏览器。它可以浏览网站,与网站互动,并完成基本的在线任务,如订购比萨饼。甚至,这个AI还能自行查找地址,填写邮编,付钱完成订单。站长网2023-04-19 16:15:280000QQ飞车上线薛之谦跑车,网友的嘴角比AK都难压!
游戏圈请明星代言,并不是什么新玩法。从拍摄广告片、演唱主题曲,到公开体验游戏、参与游戏制作,明星与游戏的合作,早就从提高知名度迈向了下一个阶段。不过最近,兵法先生看到一个非常超前的案例——QQ飞车与薛之谦的联动。站长网2024-07-05 16:48:540001百度星河社区 ERNIE Bot SDK开放文心大模型4.0开发权限申请
在2023年百度世界大会上,百度宣布发布了文心大模型4.0。相比于之前的版本,文心大模型4.0在理解、生成、逻辑、记忆四个方面都有显著的提升。目前,星河社区ERNIEBotSDK正式开放文心大模型4.0的开发权限申请。开发者可以使用ERNIEBotSDK开发文心一言应用、开发文心一言插件,甚至可以接入自有产品。站长网2023-10-26 08:46:570000