微软亚洲研究院推出NUWA-XL超长视频生成模型
站长网2023-04-20 11:16:452阅
你相信吗?只要输入16句简单描述,AI就能生成11分钟的动画了。
近日,微软亚洲研究院推出了NUWA-XL超长视频生成模型,采用创新的Diffusion over Diffusion架构,通过「从粗到细」的生成过程,可以并行生成高质量的超长视频,为多模态大模型提供了新的解题思路。

论文地址:https://arxiv.org/abs/2303.12346
NUWA-XL「从粗到细」的生成方法具有三个优势:
分层结构使模型能够直接在长视频上进行训练,从而消除了训练和推理之间的差距。
模型包含多个局部扩散模型,自然支持并行推理,可以显著提高生成长视频时的推理速度。例如在相同的硬件设置下,当生成1024帧时,NUWA-XL 使平均推理时间从7.55分钟减少到26秒,速度提升了94.26%。
由于视频的长度可以相对于深度 m 呈指数级扩展,因此模型可以很容易地扩展出更长的视频。

目前,长视频生成的多数方法是采用「Autoregressive over X」架构,这种方法存在训练-推理差距的问题,导致不真实的、扭曲的镜头变化。
NUWA-XL的推出填补了长视频生成领域的空白,为人工智能在视频生成方面的应用提供了新的可能性。
微软亚洲研究院首席研究员段楠表示,目前人工智能多模态大模型的研发仍停留在文字生成阶段。即使GPT-4已经在理解方面加入了视觉信息,但仅限于图片,输出依旧是文字或代码。因此,当前和未来的研究方向非常明确,就是将语言和视觉的理解和生成融入到一个基础大模型中,以增强图像、视频和音频的生成。他希望未来可以使用一套结构来融合支持语言和视觉的生成算法,使人工智能模型更加通用。
0002
评论列表
共(0)条相关推荐
B站UP主录制渣女AI视频播放量超两百万 一声“哥哥”引10万人点赞
1月29日,B站UP主“老麦的工具库”发布了一条题为“AI逐渐变态起来,令人心动的渣女AI来了”的视频,该视频迅速走红,播放量超过两百万,点赞数破10万。与ChatGPT语音功能上线时的热门玩法相似,UP主通过语音对话引入话题,首次呼吁将AI设定为女声并称其为“哥哥”,引起了观众的广泛关注。站长网2024-02-06 14:19:090000“人形机器人第一股”诞生!优必选上市首日市值逼近390亿港元,人形机器人加速驶向商业化
史上第一次!人形机器人在港交所现场同人类一起敲锣。这架势,这阵仗吸引了无数关注,成为在场所有人类的焦点。现场,熊猫机器人优悠走上舞台,为优必选创始人、董事长兼CEO递上锣锤。更令人瞩目的是,优必选全新一代工业版人形机器人WalkerS首次亮相,手持另一个锣锤走向舞台中央,与周剑一起敲响开市锣。自此,全球“人形机器人第一股”诞生,来自中国,来自优必选。0000IBM 宣布扩大与亚马逊 AWS 合作关系:为客户提供生成式 AI 解决方案和专业知识
站长之家(ChinaZ.com)10月19日消息:IBM今日于官网发布新闻稿宣布,扩大其与亚马逊云服务(AWS)的合作关系,以帮助更多共同客户实施生成人工智能(AI)并从中获取价值。图片来自IBM站长网2023-10-19 09:56:300000Meta更新AI模型Code Llama70B 准确性更高
Meta最新更新了其代码生成AI模型,CodeLlama70B,这是“目前最大、最优秀的模型”。CodeLlama工具于2023年8月推出,无论是研究还是商业用途,都是免费的。根据Meta的AI博客上的一篇文章,CodeLlama70B能够处理比以前版本更多的查询,这意味着开发者可以在编程时输入更多的提示,而且它的准确性也更高。站长网2024-01-30 08:42:260000AI日报:OpenAI全能模型GPT-4o发布;阿里推自动化视频剪辑神器;AI作品会侵权吗?调研结果...;零一万物开源Yi-1.5模型
欢迎来到【AI日报】栏目!这里是你每天探索人工智能世界的指南,每天我们为你呈现AI领域的热点内容,聚焦开发者,助你洞悉技术趋势、了解创新AI产品应用。新鲜AI产品点击了解:https://top.aibase.com/1、干翻所有语音助手!OpenAI全能模型GPT-4o发布站长网2024-05-14 15:08:340000