阿里云再推视频生成大模型,2分钟生成高清电影级效果视频

电商报
2023-09-06 11:15

近日,阿里云推出全新视频生成大模型I2VGen-XL,并在魔搭社区开放体验,用户上传一张图片后2分钟左右即可生成一段1280*720的高分辨率视频,该模型研发负责人表示,未来将进一步实现2K超清效果,可应用于短视频内容生产、电影制作等场景。

 

format-jpgI2VGen-XL在魔搭社区开放体验

 

和业界爆火的AI绘画创作大模型不同,视频生成大模型的技术门槛更高,其需要克服文本和视频内容匹配度、视频画面质量、画面连续性等诸多技术挑战。在此之前,阿里云和微软等科技公司相继推出一系列可控视频生成研究成果,例如用户可通过定义空间布局、运动模式等条件来生成视频,但其画面清晰度难以满足真实场景应用的需求。

 

针对该问题,阿里云进一步提出创新思路,I2VGen-XL模型设计了两个阶段,首先在低分辨率条件下保证生成结果和给定图像语义的匹配度,随后通过视频扩散模型(VLDM)来提高视频分辨率,并同时提升时间和空间上的一致性,保证最终视频内容的清晰度和连贯性,最终实现1280*720高分辨率的突破,并且在画面细节的展现上大幅领先现有模型。据介绍,该模型的训练还使用了多种风格的视频数据,因此可生成科技感、电影色、卡通风格和素描等类型丰富的视频。

 

format-jpg

I2VGen-XL流程图

 

目前,I2VGen-XL的模型和代码均已开源,国内外社交媒体显示,该模型已吸引国内外用户和开发者的广泛体验和二次开发,涌现了大量创意AI视频生成内容,例如在城堡上展翅的恐龙、宇航员在飞船中行走的科幻电影画面等等……知名AI社交媒体分析师Ahsen Khaliq在推特发布多条由该模型生成的视频效果,并表示模型在清晰度、纹理、语义和时间连续性方面有优势。

 

format-jpg

国内外网友和开发者广泛关注和体验

 

在视觉生成领域,阿里云此前已推出AI绘画创作大模型通义万相(基座模型Composer)和可控视频生成模型VideoComposer,团队在该领域发表60多篇CCF-A类论文,并在国际顶级视觉竞赛中获得10余项冠军。

 

模型体验链接:https://modelscope.cn/studios/damo/I2VGen-XL-Demo/summary

1、该内容为作者独立观点,不代表电商派观点或立场,文章为作者本人上传,版权归原作者所有,未经允许不得转载。
2、电商号平台仅提供信息存储服务,如发现文章、图片等侵权行为,侵权责任由作者本人承担。
3、如对本稿件有异议或投诉,请联系:info@dsb.cn
相关阅读
阿里推出全新视频生成大模型I2VGen-XL,并在魔搭社区开放体验,用户上传一张图片后2分钟左右即可生成一段1280*720的高分辨率视频。
9月6日消息,阿里近日推出全新视频生成大模型I2VGen-XL。该模型研发负责人表示,该模型可应用于短视频内容生产、电影制作等场景。
12月2日消息,上海电信日前与阿里签署战略合作协议,双方将围绕计算与人工智能开展深度合作,共同推动上海及长三角地区政企客户的数字化与智能化转型。根据协议,双方将聚焦人工智能、智算基础设施和网融合,基于通义千问大模型和阿里全栈AI基础设施,联合打造“+网+AI”一体化解决方案,推动政务、医疗、制造、交通等重点行业数字化升级,服务上海城市数字化转型和国家科技战略布局,并助力中国企业高质量出海。
11月25日消息,阿里巴巴发布2026财年第二财季财报。财报显示,阿里季度收入继续加速增长34%,AI相关产品收入连续9个季度实现三位数同比增长。千问App公测一周新下载量已超1000万。未来,千问还将陆续接入电商、地图、本地生活等阿里业务生态场景。
11月20日消息,在第九届材料基因工程国际论坛上,新材料大数据中心与阿里联合发布首个钢铁材料设计大模型。该模型基于阿里通义千问实现了从数据挖掘、“成分-工艺-性能”一体化设计到专业知识智能问答的全链路突破,在材料研发场景中,性能预测精度最高可达90%。目前,该模型已成功应用于生产实践,基于该模型研发的新材料具有优异的抗硫化氢开裂性能,已于上月在新疆油田正式投入井下应用。
11月14日消息,广汽集团与阿里正式签署全栈AI战略合作协议。双方将发挥各自在汽车与AI领域的优势,共建汽车行业面向未来的基础设施,并加速AI在汽车行业全场景落地。根据协议,广汽集团将依托阿里领先的基础设施与通义系列大模型,构建AI驱动的全链条体系,覆盖研发、生产、营销、管理及用户服务。
11月13日消息,阿里大模型服务平台百炼发布通知,于北京时间2025年11月13日开始对中国站-北京的通义千问3-Max模型实行降价。降价后,batch调用半价;隐式缓存,对命中缓存的部分,按输入Token标准单价的20%计费;显式缓存,用于创建缓存的Token按输入Token标准单价的125%计费,后续命中仅需支付10%的费用。