微软亚洲研究院推出NUWA-XL超长视频生成模型
站长网2023-04-20 11:16:452阅
你相信吗?只要输入16句简单描述,AI就能生成11分钟的动画了。
近日,微软亚洲研究院推出了NUWA-XL超长视频生成模型,采用创新的Diffusion over Diffusion架构,通过「从粗到细」的生成过程,可以并行生成高质量的超长视频,为多模态大模型提供了新的解题思路。
论文地址:https://arxiv.org/abs/2303.12346
NUWA-XL「从粗到细」的生成方法具有三个优势:
分层结构使模型能够直接在长视频上进行训练,从而消除了训练和推理之间的差距。
模型包含多个局部扩散模型,自然支持并行推理,可以显著提高生成长视频时的推理速度。例如在相同的硬件设置下,当生成1024帧时,NUWA-XL 使平均推理时间从7.55分钟减少到26秒,速度提升了94.26%。
由于视频的长度可以相对于深度 m 呈指数级扩展,因此模型可以很容易地扩展出更长的视频。
目前,长视频生成的多数方法是采用「Autoregressive over X」架构,这种方法存在训练-推理差距的问题,导致不真实的、扭曲的镜头变化。
NUWA-XL的推出填补了长视频生成领域的空白,为人工智能在视频生成方面的应用提供了新的可能性。
微软亚洲研究院首席研究员段楠表示,目前人工智能多模态大模型的研发仍停留在文字生成阶段。即使GPT-4已经在理解方面加入了视觉信息,但仅限于图片,输出依旧是文字或代码。因此,当前和未来的研究方向非常明确,就是将语言和视觉的理解和生成融入到一个基础大模型中,以增强图像、视频和音频的生成。他希望未来可以使用一套结构来融合支持语言和视觉的生成算法,使人工智能模型更加通用。
0002
评论列表
共(0)条相关推荐
抖音电商MCN机构等级体系上线 可获权益激励资源扶持
昨日,抖音宣布「抖音电商MCN机构等级体系」上线,「抖音电商MCN机构等级体系」将通过多元的评价维度,为MCN机构经营提供更全面、多向、灵活的提升引导。该体系覆盖经营力、成长力、服务力三个维度及附加分评定,分别对应生意经营、橱窗场景、口碑分与无忧服务等考核标准。站长网2023-04-14 08:32:380000Valla.ai:将代码逻辑展示为可视化的流程图
划重点:⭐️允许用户通过可视化的方式快速理解代码,减少在bug和技术债务上的时间⭐️减少阅读代码的时间,更多时间用于构建功能⭐️提供了代码浏览、数据流可视化和团队协作功能。Valla.ai是一个让开发者能够快速浏览、理解代码的平台。这个工具可以减少在繁琐代码阅读上的时间,将更多精力投入到功能的开发上。站长网2024-03-12 12:21:100006郭明錤:2024年iPhone出货面临显著衰退 出货预估至约2亿部
苹果公司的著名分析师郭明錤在最新的研报中表示,苹果公司已经降低了2024年iPhone的出货预期,只有大约2亿部(比去年减少了15%)。在全球各大手机品牌中,苹果可能是下滑幅度最大的一个。站长网2024-01-31 08:45:470000腾讯高管谈友商云服务降价:不会带来巨大影响
腾讯控股高管在2023年一季度财报电话会上透露,友商云服务的价格调整对腾讯确实会带来一些影响,但云业务在公司总收入中所占比例仅为个位数,并未超过10%。云服务只是公司的一种基础设施,并不是主要收入来源。站长网2023-05-18 08:43:260000苹果将面临反垄断诉讼 指控 iOS Apple Pay 占据主导地位
站长之家(ChinaZ.com)9月28日消息:据国外媒体报道,加利福尼亚北区法官杰弗里·怀特(JeffreyWhite)拒绝了苹果公司的请求,该请求旨在驳回针对其移动支付服务ApplePay的联邦集体诉讼。三家信用合作社声称苹果公司对交易收取过高的费用,并且限制了其他数字钱包使用其NFC扫描硬件,这被认为过于垄断,违反了《谢尔曼反托拉斯法》。站长网2023-09-28 11:21:240000