谷歌被打脸!Gemini Pro被证实和GPT3.5差距不大
要点:
在CMU的研究中,Gemini Pro被与GPT-3.5和Mistral8×7B进行了深入的比较,结果显示GPT-3.5在多个任务上几乎全面优于Gemini Pro,但差距不大。
通过测试任务包括基于知识的问答、通用推理、数学问题、代码生成等领域,Gemini Pro在某些任务上表现较差,但在特定任务中超越了GPT-3.5。
文章强调Gemini Pro是多模态的,通过视频、文本和图像训练,而GPT-3.5Turbo和GPT-4Turbo主要基于文本,Mixtral是开源竞争对手。
谷歌最新发布的Gemini Pro自发布以来备受瞩目,谷歌声称其优于GPT-3.5。然而,CMU的研究通过深入的实验对比,展示了GPT-3.5在多个任务上的全面优势。Gemini Pro虽然在某些任务上稍显不足,但整体表现与GPT-3.5相近,为大模型领域的竞争增添了新的火花。

论文地址:https://arxiv.org/pdf/2312.11444.pdf
研究涉及了基于知识的问答、通用推理、数学问题、代码生成等多个领域。在基于知识的问答任务中,Gemini Pro在一些子任务上落后于GPT-3.5,尤其在多选题答案输出中显示了一定的偏见。通用推理测试中,Gemini Pro的精度略低于GPT-3.5Turbo,尤其在处理较长、复杂问题时表现不佳,而GPT-4Turbo则表现更为稳健。
数学问题领域的测试包括小学数学基准、稳健推理能力、不同语言模式和问题类型等。Gemini Pro在某些任务上略显不足,特别是在多样化的语言模式任务中,表现较GPT-3.5Turbo稍逊。在代码生成方面,Gemini Pro在两项任务上的表现均低于GPT-3.5Turbo,与GPT-4Turbo相比则差距更大。
总体而言,Gemini Pro作为多模态模型,尽管在某些任务上稍显不足,但在特定领域表现出色,超越了GPT-3.5。然而,在大多数测试中,GPT-3.5Turbo仍然保持领先地位,证明其在开源模型中的卓越性能。这一研究为科技领域的大模型竞争提供了客观中立的第三方对比,为未来的模型发展提供了有益的参考。
Infosys 与 Google Cloud 扩大合作:共同构建 AI 驱动的未来体验
站长之家(ChinaZ.com)10月19日消息:印度IT巨头印孚瑟斯Infosys宣布,将扩大与GoogleCloud的合作伙伴关系,以帮助企业借助InfosysTopaz产品和GoogleCloud的生成式AI解决方案构建AI驱动的体验。图片来自Infosys站长网2023-10-19 17:57:090001奇安信发布奇安信大模型Q-GPT 可降低数据安全风险
8月25日,奇安信集团发布了Q-GPT(奇安信大模型)安全机器人和大模型卫士。大模型卫士集安全风险发现、大模型访问控制、数据泄露管控、违法违规行为溯源、大模型应用分析等为一体,可以帮助企业更安全地向大模型要生产力。据悉,奇安信大模型卫士可为企业在使用大模型过程中提供四重防护:第一是防止数据投喂造成的敏感数据泄露。包括建立内部技术监管手段,防止员工向大模型投喂敏感数据。站长网2023-08-26 17:01:240000报告:到2032年,全球AI医疗影像市场规模将达到298 亿美元,复合年增长率为 32.1%
文章概要:1.全球医疗影像人工智能市场正以32.1%的复合年增长率迅速增长,主要因素包括在放射学中应用人工智能的增加以及对人工智能支持的CT需求不断上升。2.2022年,全球医疗影像人工智能行业创造了19亿美元的收入,预计到2032年将达到298亿美元,呈现出强劲的增长态势。站长网2023-10-10 16:51:310000聊聊短剧CPS的机会和坑
一、前言最近几个月主要在忙些具体项目的相关事情,同时也花了不少精力在做我们私董会相关的交付工作,所以在整个5月我都没在公众号写文章。早上收到一条微信消息,说老胡你的公众号咋好久没更新了,是不是最近没啥可写的?站长网2023-06-17 08:34:260001微软技术主管表示英伟达人工智能芯片的供应正在改善
微软技术主管KevinScott周三表示,与几个月前相比,该公司现在更容易获得运行人工智能工作负载的英伟达芯片。Scott在加利福尼亚州DanaPoint的CodeConference上发言时说,英伟达GPU市场正在逐渐开放。自微软支持OpenAI去年底推出ChatGPT聊天机器人以来,这些GPU一直供不应求。站长网2023-09-28 14:25:450000