微软亚洲研究院推出NUWA-XL超长视频生成模型
站长网2023-04-20 11:16:452阅
你相信吗?只要输入16句简单描述,AI就能生成11分钟的动画了。
近日,微软亚洲研究院推出了NUWA-XL超长视频生成模型,采用创新的Diffusion over Diffusion架构,通过「从粗到细」的生成过程,可以并行生成高质量的超长视频,为多模态大模型提供了新的解题思路。
论文地址:https://arxiv.org/abs/2303.12346
NUWA-XL「从粗到细」的生成方法具有三个优势:
分层结构使模型能够直接在长视频上进行训练,从而消除了训练和推理之间的差距。
模型包含多个局部扩散模型,自然支持并行推理,可以显著提高生成长视频时的推理速度。例如在相同的硬件设置下,当生成1024帧时,NUWA-XL 使平均推理时间从7.55分钟减少到26秒,速度提升了94.26%。
由于视频的长度可以相对于深度 m 呈指数级扩展,因此模型可以很容易地扩展出更长的视频。
目前,长视频生成的多数方法是采用「Autoregressive over X」架构,这种方法存在训练-推理差距的问题,导致不真实的、扭曲的镜头变化。
NUWA-XL的推出填补了长视频生成领域的空白,为人工智能在视频生成方面的应用提供了新的可能性。
微软亚洲研究院首席研究员段楠表示,目前人工智能多模态大模型的研发仍停留在文字生成阶段。即使GPT-4已经在理解方面加入了视觉信息,但仅限于图片,输出依旧是文字或代码。因此,当前和未来的研究方向非常明确,就是将语言和视觉的理解和生成融入到一个基础大模型中,以增强图像、视频和音频的生成。他希望未来可以使用一套结构来融合支持语言和视觉的生成算法,使人工智能模型更加通用。
0002
评论列表
共(0)条相关推荐
真我13 Pro系列将搭载AI超清功能 模糊照片一键清晰
站长之家(ChinaZ.com)8月21日消息:真我手机品牌今日宣布,真我13Pro系列搭载了先进的AI超清功能,旨在彻底解决照片模糊的问题。官方自信宣称,这项技术能让用户告别模糊照片,实现一键将废片变为超清大片,让世界再无模糊影像。真我13Pro系列的摄影能力得到了显著提升,首发搭载了索尼LYT-600潜望长焦镜头,支持3倍光学变焦、6倍无损变焦和最高120倍数码变焦。站长网2024-08-21 14:04:200000AI视频后期制作神器ProPainter 一键即可完成视频抠图
最近,出现了一种新的视频修复技术,叫做ProPainter,它可以用画家风格的笔触来填补视频中的缺失区域。ProPainter是一个基于深度学习的端到端的网络,它由两个模块组成:RecurrentFlowCompletionNetwork和PainterlyRenderingNetwork。项目地址:https://github.com/sczhou/ProPainter站长网2023-10-24 22:12:290001性能可期!骁龙8 Gen3工程机跑分曝光:Geekbench5单核1700、多核6600分
高通即将发布的新款处理器骁龙8Gen3(SM8650)参考设计工程机在Geekbench5中单核得分为1700分、多核达到了6600分,在Geekbench6中单核成绩为2200分,多核成绩7000分。0000在线教育出海掘金,攥紧AI
当国内的在线教育进入存量争夺后,不少教育科技类公司为寻求新增长,将目光望向了海外。然而教育不同于普通商品,面对历史、人文、政治、经济差异悬殊的海外市场,虽有着巨大潜力,但实现本土化运营并非易事。值得注意的是,由于全球化合作所衍生的“中文热”现象,海外市场在中文职业教育、高等教育以及K12教育上有着很明确的中文需求。落地是中文赛道的海外市场空间,能够通过ToB或ToG模式实现规模效益。站长网2024-05-09 23:07:210000估值数十亿,批量生产数字人!中国独角兽盯上直播电商
硅基智能创始人司马华鹏最近“写”了一本新书——《大模型时代:ChatGPT拉开硅基文明序幕》。确切地说,这本围绕人工智能、大模型、ChatGPT、数字人等领域展开讨论,前后洋洋洒洒数十万字的著作,是他与团队一起勾勒出框架和脉络,然后交给ChatGPT完成撰写的。甚至,AI还揽下了部分的销售工作。与DNA编码为核心的碳基生命相对应,以文本编码为核心的AI智能体为社会注入了新的硅基劳动力资源。站长网2023-09-10 08:38:490000