文章核心观点 AI视频生成行业正从单纯的价格竞争转向以“智能水平”为核心的效率竞争,核心在于模型对物理世界的理解与推演能力,这决定了生成视频的可用率和真实成本,而智象(HiDream.ai)通过其原生全模态架构和世界模型战略,试图在这一转型中占据领先地位 行业竞争格局与成本变化 - 视频生成单价持续下跌,圈内流传“6毛一秒”的价格,但生成费用降低并未节省返工成本,因为拿到一条可用镜头的试错开销并未下降 [2] - 不同报价对应不同分辨率、时长、音频能力和套餐条件,难以直接比较,对用户而言,交付一条合格镜头的真实成本取决于生成效率,即同一段镜头需要尝试多少次才能得到连贯自然的结果 [2] - 头部模型轮番降价,但成片流水线上的试错开销一点没省,价格竞争只能解决视频生产的一部分问题 [6] - 2026年上半年,国内世界模型相关融资超过三十起,总额超过四十亿元;海外,李飞飞的World Labs拿下超十亿美元融资,杨立昆的AMI Labs以10.3亿美元种子轮创下欧洲AI领域纪录 [22] - 行业缺少公平、标准、统一的评测基准,多数评测还停留在视频生成指标上,而世界模型真正需要的是物理因果推演能力 [23] 智象的技术路线与产品发布 - 2026年9月16日,智象推出原生全模态视频模型HiDream-O1-Video-1.0,将物理规律和模型智能放在产品叙述中心,旨在改善模型理解要求、保持动作连贯并让事件按合理因果关系发生 [3] - 该模型从立项到发布用了半年左右,技术架构创新包括三处:理解模型(先理解后生成)、原生全模态架构(视频、文本、音频在共享空间交互,采用linear attention与full attention混合模式)、后训练(用强化学习提升物理规律合理程度和音画同步程度) [10] - 前置理解模型先读懂画面里的物理规律和文本,再做规划:镜头多长、场景在哪、画面里有什么、用哪种景别和构图、台词与背景声怎么设计 [11] - 规划清单中权重最高的部分交给物理,包括物体在重力下怎么落、碰撞怎么反馈、惯性怎么延续、光影怎么衰减、空间怎么保持连续 [13] - 在Artificial Analysis带音频图生视频榜上,HiDream V1排名全球第四,与MiniMax H3、字节Seedance系列、阿里Wan 3同处于全球头部视频模型梯队 [8] - 智象的视频模型经历了从TGANs-C到DiT、再到扩散自回归、最终走向UiT架构的完整演进 [25][26] - 2024年1月,智象率先实现超15秒视频生成技术突破;同年7月,推出全球首个商用DiT大模型HiDream 2.0;12月,发布采用扩散自回归架构的HiDream 3.0 [25] - 2026年4月底,公司推出统一原生全模态架构与图像大模型HiDream-O1-Image;8月发布原生全模态交互式世界模型HiDream-O1-World;9月7日发布具身世界模型HiDream-O1-Embodied [23] 物理规律与智能水平 - 制约视频模型智能水平的关键在于物理规律做得差,把训练数据复刻一遍算不上智能,训练集长什么样就出什么样只是复制 [11] - 语言模型对物理规则的理解本身够用,它能做物理题,缺的是把这层理解迁移到视觉模型,这个缺口不能通过补充数据或堆叠3D仿真合成样本解决 [16] - 智能水平从几个角度衡量:对用户意图的理解、对生成过程的强推演、对物理规律的体现 [16] - 物理规律遵循得好的直接收益体现在素材可用率上——少抽卡、一遍过、能直接剪 [15][16] - 当物理和时长成为模型自己会算的事,创作者在提示词里打的补丁都可以删掉,提示词重新回到讲故事本身 [18] - 新的视频模型在物理规律上算往前迈了一小步 [20] 世界模型战略与具身智能 - 梅涛把世界模型拆成三步:先学各种模态的表达对现实完整建模;再结合物理法则和因果推演(Reason the world);最终顺着人的想法把物理世界重建出来(mold the world) [5] - 智象的定位是“视频领域的Anthropic”,避开大厂锋芒,顺着垂直场景优化模型,做企业服务而不是单纯追C端流量 [35] - 姚霆把护城河拆成四层:最底下是基础模型能力;往上是标准功能;再往上是行业定制能力;最顶层是嵌进产业流程的端到端工作流,真正的壁垒在三四层 [35] - 具身智能成了智象进入世界模型的其中一个切口,HiDream V1对具身智能的助力有两处:数据生成层面产出物理规律更合理的视频做训练数据扩增;架构层面可以更好地搭建World Action Model [38] - 智象未来在具身训练数据上已经做到毫米级精度的合成数据生成,如果误差达到毫米级,可能不仅仅是预训练,后训练都会有很大的作用 [40] - 做视频生成模型的这波人最有可能把世界模型做成,拥有视频模型训练能力的公司已经具备世界模型训练基础 [37] 音画协同与时长控制 - 音画同生指的是声音随画面一起生成,敲击、说话、环境变动与对应的声音天然踩在同一个节拍上,无需等视频做完再贴配乐,省掉一整道对轨工序 [16] - 原生音画联合建模的优势在于对齐,感知上更自然;若走两阶段方案先出画面再贴音频,两者之间容易割裂 [17] - 代价集中在算力,音画联合建模的训练周期比单任务单模态要长一些 [17] - 用户没有卡死秒数时,模型顺着动作幅度与叙事节律判断镜头长短;专业创作者也可以自己定时间,镜头不必为了凑整硬塞进固定的时间格 [17] 未来规划与商业化 - 接下来一个月内,V1的意图理解、物理模拟与音画协同会全部接入Agent [36] - 视频模型的竞争还远未到语言模型“神仙打架”的阶段,路线尚未收敛,但技术迭代在加快,从原来大概一年一迭代缩短到半年左右 [42] - 世界模型的构想再宏大,撑起它的始终是那些不起眼的物理常识:杯子会不会突然蒸发、动作前后接不接得上、金属撞击与声音波形对不对得齐 [42]
6毛一秒后,AI视频开始补物理课