“快手版Sora”可灵开放测试 最长可生成2分钟视频
快手公司推出了一款名为可灵的全新国产视频生成大模型,它采用了与Sora相似的技术路线,并结合了快手自研的技术创新。这款模型能够生成长达2分钟、30fps、1080p分辨率的超长视频,并支持多种宽高比。不同于实验室的Demo或视频演示,「可灵」是快手推出的产品级应用,并已在快影APP中正式开启邀测。
可灵大模型能够在想象中天马行空,同时在描绘运动时符合真实的运动规律,准确刻画复杂、大幅度的时空运动。它不仅能模拟真实物理世界的特性,生成符合物理规律的视频,还能处理与真实物理世界的交互,例如在视频中展现小男孩吃汉堡时齿印的变化。

可灵采用了原生的文生视频技术路线,替代了图像生成加时序模块的组合,这是它能够生成视频时间长、帧率高,并准确处理复杂运动的关键。快手大模型团队着重考虑了模型设计、数据保障、计算效率以及模型能力的扩展这四大核心要素。
在模型设计方面,可灵采用了类Sora的DiT结构,用Transformer代替了传统扩散模型中基于卷积网络的U-Net,并通过自研的3D VAE网络和全注意力机制(3D Attention)提升模型的建模能力。
数据构建方面,快手大模型团队构建了完备的标签体系,精细化筛选训练数据,并研发了视频描述模型,以生成精确、详尽、结构化的视频描述。
运算效率方面,「可灵」使用了传输路径更短的flow模型作为扩散模型基座,并采用分布式训练集群和算子优化等手段提升硬件利用率。
模型能力扩展方面,「可灵」支持自由的长宽比,并研发了基于自回归的视频时序拓展方案,同时还支持多种控制信息输入。
可灵大模型的应用不仅限于视频生成,快手还基于此模型推出了其他应用,如"AI舞王"和"AI唱跳",并即将推出图生视频功能。
快手在大模型技术方面动作迅速,已与多个高校或科研机构合作发布了多项关键技术,为可灵大模型积累了深厚的技术沉淀。现在,快手的文生视频功能已正式亮相,期待其在短视频场景中的应用落地。
对AI视频创作感兴趣的用户,可以在快影APP中体验可灵大模型的功能。
官网地址:https://kling.kuaishou.com/
2025 年人工智能的四大预测:从瓶颈到突破,下一步是什么?
2024年,人工智能领域虽未出现如首次体验ChatGPT时那般惊艳的突破性创新,但基础技术的稳步进展仍使这一领域保持热度。那么,2025年AI将走向何方?人工智能的发展会遇到瓶颈吗?0000一场脑机接口的大赛,看到时代需要的「AI超级底座」
「AI超级底座」有什么价值?小到一场竞赛,大到整个产业。从2022年开始,大模型就成为了最热门的技术关键词,这种热度显然辐射到了多个相关领域。比如,在近日召开的2023世界机器人大会上,「大模型机器人」就成为现场讨论最多的话题。站长网2023-08-23 18:08:420000百度发布 Comate 代码知识增强2.0 内置10000+Github热门代码库
站长之家(ChinaZ.com)5月22日消息:近日,百度发布了百度智能代码助手Comate的最新成果——Comate代码知识增强2.0。站长网2024-05-22 19:53:440002菜鸟推出自营快递“菜鸟速递”
6月28日,菜鸟集团宣布推出自营的快递业务“菜鸟速递”。“菜鸟速递”由服务天猫超市的配送业务升级为全国快递网络,主打好用不贵的半日达、当次日达和送货上门等品质快递服务。站长网2023-06-29 11:34:500000OpenAI多模态AI系统GPT-Vision即将推出 与谷歌Gemini竞争
据TheInformation报道,知情人士透露,鉴于谷歌上周开始向部分企业测试其多模态大模型Gemini,OpenAI希望抢占先机,推出自己的多模态AI系统。OpenAI在3月份推出语言模型GPT-4时曾预览了多模态功能,但至今仅向为盲人提供服务的BeMyEyes公司开放。六个月过后,OpenAI准备大范围推出这款名为GPT-Vision的多模态系统。站长网2023-09-19 15:10:140000