Workflow
可灵
icon
搜索文档
AI视频生成模型行业分析报告V1.0
-· 2026-07-24 17:35
投资摘要 - 行业评级:AI视频生成是全球生成式AI赛道中少数同时具备“可验证的商业化收入”和“尚未被充分定价的差异化投资机会”的领域 [3] - 核心观点:行业正站在盈利拐点,而非概念期,已跨越“AI视频能不能赚钱”的阶段,进入“谁能赚钱、赚谁的钱”的格局分化期 [8] - 核心观点:B端是已验证的盈利路径,但C端的投资叙事被过度简化了,问题不在C端本身,而在于当前产品形态与C端用户行为之间存在五重结构性错配 [8][9] - 核心观点:巨头垄断了公开市场,但私有化部署是一个被低估的平行市场,六行业强制信创为AI视频的私有化部署创造了刚性需求 [9] - 核心观点:“推理成本降至行业10%”不是一个技术假设,而是一个需要多重工程路径协同突破才能成立的判断 [9] - 核心观点:低成本路线的最大风险不是技术不可行,而是“巨头反制的时间窗口”,字节和快手具备在12-18个月内推出低价版本的能力 [9] 市场规模与增长 - 全球市场:2025年全球AI视频生成模型市场收入约12亿美元,预计到2030年可寻址市场规模达到827亿美元,未来五年复合增长率约120% [3] - 中国市场:2025年中国市场规模约12.15亿元人民币,预计到2030年增长至144.39亿元 [3] - 市场结构:2030年总可寻址市场(TAM)约827亿美元,其中电影/电视剧/动画制作192亿美元,视频广告制作464亿美元,微短剧108亿美元,原生AI漫剧63亿美元 [14] - 可服务市场(SAM)约400亿美元,B端约占90%,C端创作者订阅约占10% [15] - 私有化部署平行市场:2025年国内私有化AI平台市场规模487.6亿元,同比增长21.3%,六大强制信创行业(政务、金融、军工、能源、文博、公办教育)的AI视频需求估算为50亿至200亿元,约8倍于2025年12.15亿元的公开市场规模 [16] - 增长驱动力:短视频生态对内容供给的持续性需求、影视工业对成本效率的极致追求、广告营销行业对程序化创意的结构性迁移 [3] - 增长双轨特征:C端增长依赖用户规模和付费转化率的渐进提升,是“慢变量”;B端和G端增长绑定产业效率提升和政策强制要求,是“快变量” [37] 竞争格局 - 全球两极格局:中国厂商以字节跳动Seedance(2026年ARR约20亿美元)和快手可灵(ARR约5亿美元)为代表,在收入规模上大幅领先;美国厂商Runway(ARR约0.9亿美元)、Google Veo则在技术前沿和全球品牌上保有优势 [4] - 流量格局:2026年6月,Dreamina(即梦海外版)和Kling AI分别以1281万和1265万月访问量位居AI视频生成品类前两名,中国产品在全球流量榜上占据主导地位 [67] - Seedance单月收入超10亿元,毛利率约70%,按内部口径已接近盈亏平衡;可灵Q1收入超6.5亿元;Runway预计2026年底实现盈亏平衡 [8][85] - 竞争焦点转移:从“谁的模型更好”向“谁的生态更完整”和“谁的商业效率更高”迁移 [30] - 制胜关键要素:生态卡位优先于模型能力;B端生产力场景是当前唯一被验证的规模化盈利路径;成本效率决定商业化天花板;数据护城河被系统性低估 [68][71] - 初创企业机会:避免在巨头已建立规模效应的维度正面竞争,可在成本效率、服务深度和响应速度等维度建立优势 [74] 技术演进 - 技术路线:DiT架构成为行业共识,Flow Matching取代传统DDPM成为主流训练范式,当前竞争焦点已从架构创新转向工程优化和生态构建 [19] - 技术壁垒四层结构:数据壁垒(高质量视频训练数据稀缺)、算力壁垒(正从“强壁垒”退化为“效率壁垒”)、算法壁垒(领先窗口期缩短到“月”)、生态壁垒(最具持久性) [24][25] - 国产算力适配壁垒:深度工程挑战,涉及算子兼容性、精度对齐等,已完成全栈适配的企业形成的工程know-how构成技术壁垒,后来者需要6~12个月才能复现同等性能 [21][22] - 国产算力价值:国产芯片(昇腾910B、海光DCU)单卡价格约1万—1.5万美元,低于进口GPU(如H100单卡约3万美元),国产芯片+深度适配的组合可将硬件成本降低50%~70%,同时满足信创合规要求 [23] - 推理成本优化:行业头部产品的单次视频生成(15秒/1080p)公开云推理成本约$0.10~0.20/次,实现成本压缩至行业头部10%需要模型量化、MoE架构稀疏激活、蒸馏/剪枝、向量空间推理、国产芯片适配等多条技术路径中至少3-4项同时取得突破并协同生效 [28][29] 商业模式与用户分析 - C端用户画像:2025年全球AI视频创作者约8000万人,其中专业创作者占比约15%,付费意愿高;业余爱好者占比约60%,付费意愿极低 [38] - C端付费瓶颈:当前付费率约1%,源于产品形态与用户行为存在五重结构性错配:产出不确定性与订阅制的矛盾、价值闭环断裂、心理账户错配、刚性需求不足、巨头定价策略的自我抑制 [39][40][41] - 低成本商业模式潜力:若推理成本降至行业10%,可解锁“零负担决策”商业模式,包括扩大免费额度、废片包赔、按效果付费等,将用户心理从“投资心态”转化为“试玩心态”,建立习惯依赖 [45][46][47][48][49][50][87] - B端市场分析:2030年中国B端AI视频总支出预计约200亿—350亿元,是当前收入的主战场,商业确定性最高,付费逻辑基于投入产出比 [52][56][63] - G端市场分析:受信创政策驱动,2030年中国G端AI视频市场预计约50亿—100亿元,增速可观,竞争格局有利,但进入门槛高,核心准入门槛包括信创适配认证、等保三级、密码测评等,获取周期长 [59][62][63] 产业链与生态 - 产业链价值分配:当前利润正向中游模型平台化和上游算力层集中,下游纯内容制作层是亏损比例最高的环节(2026年AI微短剧行业90%公司亏损) [89] - 生态位战略:垂直场景深耕、开源差异化、融入现有工作流、私有化部署 [93][94][95] - 私有化部署市场:包含G端(政府/公共部门)和B端(企业/机构)两类客户,G端核心驱动力是信创政策强制要求,B端核心驱动力是数据安全合规,两者在决策逻辑、采购模式、竞争态势上存在显著差异 [96] - 私有化部署进入门槛:纯合规费用合计约40万~110万元,加上硬件和软件,总进入门槛约100万~200万元起步 [98]
梁文锋说世界模型不是主线,资本却在疯狂投入
佩妮Penny的世界· 2026-07-24 16:27
行业背景与市场观点 - “世界模型”是当前一级市场的热门投资方向,吸引了大量资金[1] - 对于“世界模型”在通往AGI(通用人工智能)路线上的重要性,业内存在不同看法。有观点认为,AI训练及持续学习是现阶段更重要的主线,而世界模型在商业上是一个好生意[1] - 行业观点认为,多模态能力是智能走向现实世界不可或缺的一环[1] 公司融资与股东结构 - 智象未来(HiDream.ai)近期完成15亿人民币的C轮融资,在三个月内完成三轮密集融资,累计融资额超过21亿人民币,已跻身独角兽行列[2] - C轮融资由社保基金四川振兴科创基金、工银资本、弘颐资管、敦鸿资本联合领投,并有厦门国贸资本、上影新视野基金、湖北长江产业投资集团、华策影视、航源资本、创云海资本、华福投资、余杭金控股份、交银资本、若松基金等多家机构跟投[2] - 股东阵容汇聚了社保基金、银行系、地方国资、头部产业资本(如上影集团、华策影视)及市场化创投机构,老股东如合肥产投、东方富海、敦鸿资产已连续跟投2-3轮[3] - 产业资本的入局为AI视频生成模型提供了庞大的IP库、制作团队、发行渠道以及真实的训练数据和应用场景[3] - 公司合肥主体已完成股改,变更为股份有限公司,后续可能有更多融资及资本市场运作,行业头部公司处于竞速阶段,预计年底或明年上半年有更多进展[5] - 资本市场已用资金投票,预计该领域将诞生百亿甚至千亿级别的上市公司[5] 公司团队与技术渊源 - 创始人梅涛是微软亚洲研究院前资深研究员,加拿大工程院外籍院士,同时是ACM、IEEE、IAPR和CAAI四大著名学会的Fellow[6] - 2017年,梅涛团队在微软亚洲研究院完成了全球最早探索文生视频方向的论文之一(TGANs-C),该论文大部分作者目前仍在公司工作[6] - 视频生成模型已成为许多视频内容创作者的重要生产资料,应用场景包括AI短剧、短视频创作及电商广告素材生成等[6][7] 技术架构与产品性能 - 公司自研了原生全模态架构UiT(unified transformer),从神经网络底层将图片、语音、视频、文本、3D交互、动作等所有信号打碎成统一的token进行联合训练,旨在实现任意模态输入和输出(any to any)[7] - 该技术方向使模型从单纯的内容生成走向“世界模型”,能够理解并预测内容的时空、因果和物理反馈[9] - 2024年5月,公司开源模型HiDream-O1-Image登顶全球独立模型评测平台Artificial Analysis文生图榜单开源模型全球第一[9] - 2024年6月,其商用版HiDream-O1-Image-1.5在相同榜单中位列全球第三、国产第一,Elo评分为1265,仅次于OpenAI的两款模型[9][10] 核心产品发布与特点 - 公司在上海WAIC大会上发布了全球首款无限时长内容创作多模态智能体Vivago R1[10] - 该产品与以往视频生成模型的核心区别在于,将重点从“单次出片”推进到“长链路创作”,旨在解决长视频创作中无限时长、长任务思考和稳定生成三大难题[12][13] - Vivago R1通过分段生成、统一编排和资产复用技术,确保角色、道具、场景和风格在长周期创作中保持一致,支持故事持续延展[13] - 产品本质是一个AI导演系统,其关键价值在于模型之上的Agent编排能力,能够将创意想法组织成可交付的视频成片,强调任务的稳定完成[13] - 产品内置多种场景技能,可生成电商广告素材、商品详情页等,并支持一键分享至YouTube、TikTok等平台[15][17] 行业趋势与商业前景 - 当前Agent行业的关键词是“长”,即让Agent能够自主规划并高成功率、低成本地完成长程任务[18] - 在模型能力之上,任务完成的编排与交付层正变得越来越重要[19] - “世界模型”被视为智能进入现实世界、创造商业价值的一条重要路径,未来可应用于影视、广告、电商、游戏、自动驾驶、机器人、工业仿真和具身智能等多个领域[20][21] - 行业竞赛已从论文和Demo阶段,进入资本、产品与产业同时加速的阶段[21]