苹果研究人员推出Ferret:一种用于高级图像理解和描述突破性多模态语言模型
划重点:
1. 研究困难:语言学习中的地理信息和语义知识融合展开,提出Ferret模型解决引用和定位问题
2. Ferret模型:采用MLLM为基础的Ferret模型,具备强大的全局理解能力,可同时处理自由文本和引用区域,性能领先传统模型。
3. 应用前景:文章指出Ferret模型可应用于日常交流中,提供了一种新的多模式语言模型,为图像理解和描述领域带来突破性进展。
研究人员在最新的一项研究中介绍了Ferret,这是一款多模式语言模型,旨在实现高级图像理解和描述。该研究聚焦于视觉-语言学习中的关键问题,即如何融合地理信息和语义知识,以便模型能够同时引用和定位图像中的元素。研究指出,引用和定位是两项关键的能力,前者要求模型理解语义描述,后者要求模型在图像中定位相关区域。
为了解决这一问题,哥伦比亚大学和 Apple 的研究人员提出了Ferret模型,这是一款基于MLLM(多模式大语言模型)的新型模型,具备强大的全局理解能力。
Ferret模型的关键特点在于它可以同时处理自由文本和引用区域。它采用了一种混合区域表示方法,结合了离散坐标和连续视觉特征,以处理不同形状的区域,如点、框、涂鸦和复杂多边形。这种灵活性使Ferret能够更准确地理解和描述图像中的元素,提高了人机交互的全面性。
为了训练Ferret模型,研究人员创建了GRIT(Ground-and-Refer Instruction-Tuning)数据集,其中包括1.1百万个样本,用于指导模型进行引用和定位。该数据集包含了不同层次的空间知识,包括区域描述、连接、物体和复杂的推理。通过精心设计的模板,大部分数据从当前的视觉-语言任务中转化而来,如对象识别和短语定位,以用于指导模型。
研究人员还利用ChatGPT/GPT-4等工具,收集了34,000多个引用和定位对话,以帮助模型进行训练。他们还进行了空间感知的负数据挖掘,以增强模型的鲁棒性。Ferret模型表现出高度的开放式空间感知和定位能力,能够在引用和定位任务上表现优于传统模型。此外,研究人员认为引用和定位能力应该融入日常人机交流中,以实现更广泛的应用。
为了评估Ferret模型的性能,研究人员创建了Ferret-Bench,包括三种新类型的任务:引用描述、引用推理和对话中的定位。他们将Ferret与目前使用的最佳MLLM模型进行比较,发现Ferret的性能平均优于它们20.4%。此外,Ferret还具有减少对象幻觉的显著能力。
Ferret模型,它具备了在MLLM中进行精细和开放式引用和定位的能力。Ferret采用了一种混合区域表示方法,配备了独特的空间感知视觉采样器。此外,他们创建了GRIT数据集,用于模型训练,并评估了Ferret在不同任务中的性能。这一研究为多模式语言模型领域带来了突破性进展,为图像理解和描述提供了新的可能性。
项目网址:https://github.com/apple/ml-ferret
论文网址:https://arxiv.org/abs/2310.07704v1
微软推出Bing AI漏洞悬赏计划 最高奖励1.5万美元
划重点:-微软启动了一项新的AI漏洞悬赏计划,奖励安全研究人员发现BingAI产品中的漏洞,奖金范围从2,000美元到15,000美元。-参与计划的产品包括BingAI套件、BingChatforBusiness、BingImageCreator,以及Bing与MicrosoftStartapp和SkypeMobileapp的AI集成。站长网2023-10-16 09:51:210000谷歌拟推迟旗下人工智能项目 Gemini AI 发布时间
据TheInformation消息,谷歌推迟了旗下人工智能项目Gemini的发布时间,该项目旨在与OpenAI竞争。今年早些时候,谷歌告诉一些云客户和商业伙伴,他们将在11月份获得该公司的新对话式人工智能Gemini的使用权限。然而,根据两位知情人士的最新消息,谷歌最近告诉他们不要指望在明年第一季度之前获得Gemini的使用权限。站长网2023-11-17 08:54:410000伦敦领先私立学校为四岁儿童开设人工智能课程
伦敦领先的学校之一Alleyn'sSchool正在引入人工智能课程,帮助孩子们应对快速发展的技术。据了解,Alleyn'sSchool将于9月份为四岁儿童推出“AiQ”课程。校长简·伦农(JaneLunnon)表示,学校正在迎接人工智能的挑战,并补充道:“教育不是把头埋在沙子里,假装东西不存在。有时它来自于与真正困难的事情作斗争。”站长网2024-04-28 21:18:210000微软Azure发布GPT-RAG,为LLM部署提供超智能解决方案
**划重点:**1.🛡️**安全第一:**GPT-RAG具备强大的安全框架,遵循零信任原则,确保敏感数据得到谨慎处理,为企业提供超级安全保障。2.🔄**自适应扩展:**该解决方案能够自动调整大小,即使在高峰期也能保持良好性能,确保在繁忙时刻仍然平稳一致。0000Meta 解散其 Responsible AI 团队,成员转至生成式 AI 产品部门
Meta公司已解散其负责人工智能(AI)安全的「ResponsibleAI」(RAI)团队,该团队原本专注于监管AI项目的安全性。据Meta发言人透露,大多数RAI团队成员已被重新分配到公司的生成式AI产品部门,而其他一些成员现在将在AI基础设施团队工作。该消息最初由TheInformation报道。站长网2023-11-20 09:14:140000