Workflow
季度AI视频生成产品:多模态输入成标配,角逐一站式生成能力 | 量子位智库AI 100
量子位·2025-10-18 15:33

AI视频生成行业动态 - Sora2在五天内下载量突破百万次,显著提升AI视频生成领域热度[3] - 谷歌推出对标产品Veo3.1,重点布局音频生成技术[4] - 国际厂商竞争聚焦电影级创意能力,国内企业追求秒级生成高清稳定视频并深耕垂直场景[5][6] - 视觉模型与世界模型深度融合,推动3D物理场景逼真化,实现无限一致视频生成[6] 技术演进趋势 - 多模态输入成为行业标配,支持文生视频、图生视频及音画同步生成[7] - 部分产品实现Agent一站式生成,构建全流程视频生成体系[7] - 输出视频时长从数秒延长至数分钟,分辨率提升至2K/4K级别,帧率达60fps[7] - 角色一致性、分镜设计、关键帧控制及口型同步等技术稳定性显著增强[7] 用户数据表现 - 5款产品访问量超20万,包括即梦AI、可灵AI、RoboNeo、海螺AI和Vidu[8] - 即梦AI下载量突破1100万,访问量增长27%至约950万[9] - 可灵AI网页端月访问量超100万,RoboNeo紧随其后[9] - 豆包、通义万相等综合类AI产品均集成视频生成功能[10] 头部产品功能特性 - 即梦AI支持3分钟视频生成,具备首尾帧控制、镜头运动及数字人口型同步功能[15] - 腾讯混元3D通过世界模型实现360°沉浸场景生成,支持物理仿真[18] - 可灵AI提供首尾帧稳定衔接及多图参考角色生成,拥有百余种风格模板[20] - 海螺AI实现2D插画转动态视频,30秒内生成6秒短视频,支持2K高清输出[24] - 绘想提供五种模型选择,支持音视一体化生成及11种特效,适配中文语境[25][27] 创新产品技术突破 - 白日梦Agent可将2000字文案转为6分钟连贯视频,支持角色DNA库与智能分镜[37][39] - Vidu最快10秒生成视频,提供4秒/8秒时长选项,分辨率达1080P[43][44] - SEELE实现零代码3D游戏生成,支持角色控制、场景构建及物理效果[60] - FilmAction支持最高16K视频生成,整合从剧本创作到视频合成的全流程[62][63]