谷歌被打脸!Gemini Pro被证实和GPT3.5差距不大
要点:
在CMU的研究中,Gemini Pro被与GPT-3.5和Mistral8×7B进行了深入的比较,结果显示GPT-3.5在多个任务上几乎全面优于Gemini Pro,但差距不大。
通过测试任务包括基于知识的问答、通用推理、数学问题、代码生成等领域,Gemini Pro在某些任务上表现较差,但在特定任务中超越了GPT-3.5。
文章强调Gemini Pro是多模态的,通过视频、文本和图像训练,而GPT-3.5Turbo和GPT-4Turbo主要基于文本,Mixtral是开源竞争对手。
谷歌最新发布的Gemini Pro自发布以来备受瞩目,谷歌声称其优于GPT-3.5。然而,CMU的研究通过深入的实验对比,展示了GPT-3.5在多个任务上的全面优势。Gemini Pro虽然在某些任务上稍显不足,但整体表现与GPT-3.5相近,为大模型领域的竞争增添了新的火花。

论文地址:https://arxiv.org/pdf/2312.11444.pdf
研究涉及了基于知识的问答、通用推理、数学问题、代码生成等多个领域。在基于知识的问答任务中,Gemini Pro在一些子任务上落后于GPT-3.5,尤其在多选题答案输出中显示了一定的偏见。通用推理测试中,Gemini Pro的精度略低于GPT-3.5Turbo,尤其在处理较长、复杂问题时表现不佳,而GPT-4Turbo则表现更为稳健。
数学问题领域的测试包括小学数学基准、稳健推理能力、不同语言模式和问题类型等。Gemini Pro在某些任务上略显不足,特别是在多样化的语言模式任务中,表现较GPT-3.5Turbo稍逊。在代码生成方面,Gemini Pro在两项任务上的表现均低于GPT-3.5Turbo,与GPT-4Turbo相比则差距更大。
总体而言,Gemini Pro作为多模态模型,尽管在某些任务上稍显不足,但在特定领域表现出色,超越了GPT-3.5。然而,在大多数测试中,GPT-3.5Turbo仍然保持领先地位,证明其在开源模型中的卓越性能。这一研究为科技领域的大模型竞争提供了客观中立的第三方对比,为未来的模型发展提供了有益的参考。
女子被好友改名文件传输助手骗5年 后续:对方已被封号
在日常生活中,许多人都习惯将微信的文件传输助手作为备份工具,但往往忽视了可能存在的风险。最近,一位名叫@布鲁克林奶王的博主分享了自己的一段经历,警示大家提高警惕。站长网2024-02-28 13:52:290000一年净赚81亿,温州商人靠“折扣特卖”闷声发财
2月28日,唯品会2023年第四季度及全年业绩报告出炉。每年第四季度通常为电商销售的旺季,唯品会也交出了成绩单,净营收、净利润、季度GMV、活跃用户数、订单量等指标全线翻红,超行业预期。财报显示,唯品会第四季度实现净营收347亿元,同比增长9.2%;净利润29.8亿元,上年同期为22.4亿元,同比增长33%;2023年第四季度GMV达664亿元,同比大增21.9%。站长网2024-03-01 14:42:2300002023高考作文来了 AI高考作文交卷了 你怎么打分?
6月7日上午,全国各地的语文高考作文题刚刚发布不久,就有网友马上用AI写作技术提交了答卷。例如四川(全国甲卷)的高考作文题是“随着技术的发展,人们更好地掌控了时间,但有些人变成了时间的奴隶。”站长网2023-06-07 19:12:160000McAfee 调查显示近半数印度人遭遇人工智能假语音诈骗:83% 受害者失去钱财
根据McAfee的一项调查,约印度一半的受访者声称他们无法区分一个人的真实声音和克隆声音,83%的语音诈骗受害者因此失去了钱财。这项针对包括印度在内的七个国家的7,054位受访者进行了有关人工智能声音欺诈的调查,其中1,010人来自印度。站长网2023-05-06 11:04:470000三星开发业界首款 32Gbps GDDR7 DRAM:进一步扩展 AI、HPC 和汽车应用等领域
三星周三宣布,已完成行业首款GDDR7DRAM的开发,这是下一代图形内存,将用于未来的计算、汽车和游戏硬件产品。该公司的重要合作伙伴预计将在今年晚些时候将新芯片安装到他们的下一代系统中进行测试。图片来自Samsung站长网2023-07-20 12:59:280002