登陆注册

支持多视觉语言任务

  • 谷歌发布开源视觉语言模型PaliGemma 支持多视觉语言任务

    谷歌推出了一款名为PaliGemma的开源视觉语言模型,该模型结合了图像处理和语言理解的能力,旨在支持多种视觉语言任务,如图像和短视频字幕生成、视觉问答、图像文本理解、物体检测、文件图表解读以及图像分割等。PaliGemma的关键特点:多任务支持:PaliGemma能够处理多种视觉语言相关的任务,提供广泛的应用场景。参数规模:该模型包含30亿(3B)个参数,是一个大型的多模态模型。
    站长网2024-05-17 11:19:58
    0000