核心观点 - 世界模型是物理AI走向泛化的核心钥匙,是下一代智能的重要技术范式之一 [9] - 2026年世界模型创业投资热潮,与2015-2016年CV赛道早期创业的现象、机制、趋势高度相似 [39] - 投资机构对世界模型创业公司的评估标准,已从基于学术信用和单点能力,转向比拼综合工程能力 [76] - 对创业公司而言,比“谁是技术冠军”或“谁是融资冠军”更重要的,是谁能活到技术收敛 [87] 行业背景与市场热度 - 2026年,世界模型成为创投圈最炽热的赛道 [15] - 2026年9月2日,李飞飞创办的World Labs发布新一代多模态世界模型Atlas,迅速刷屏科技圈和创投圈 [11][12] - “我,世界模型,打钱”成为2026年年中的热梗 [18] - 学术前沿的突破正以史上最快速度转化为创业项目,代表性转化周期已压缩至“同步至两年” [20][23] - 2024年,李飞飞提出空间智能方向,同年World Labs完成2.3亿美元融资 [23] - 杨立昆创立AMI,种子轮融资即达到10.3亿美元 [23] 全球科技巨头布局 - 海外巨头形成三条主要路线:Google DeepMind的Genie系列、Meta的JEPA架构、NVIDIA的Cosmos平台 [24] - Microsoft从游戏切入,同时建模画面变化和玩家动作 [24] - OpenAI把视频生成视为通往物理世界模拟器的潜在路径 [24] - 2024年2月,Meta发布V-JEPA [26] - 2024年2月,OpenAI发布Sora技术报告 [26] - 2024年2月,Google DeepMind发布Genie 1 [26] - 2024年12月,Google DeepMind发布Genie 2 [26] - 2025年1月,NVIDIA发布Cosmos世界基础模型平台 [26] - 2025年2月,Microsoft发布Muse/WHAM [27] - 2025年6月,Meta发布并开放V-JEPA 2 [28] - 2025年8月,Google DeepMind发布Genie 3 [28] - 2026年1月,Google DeepMind上线Project Genie研究原型 [28] - 2026年1月,NVIDIA发布开放的Cosmos 3 [28] - 中国巨头布局集中在开源、3D世界和具身智能 [29] - 字节跳动组建“多模态交互与世界模型”团队 [29] - 蚂蚁集团通过LingBot-World强化实时、长时交互 [29] - 腾讯连续发布混元世界模型1.0、1.5和2.0 [29] - 2025年7月,腾讯发布并开源混元3D世界模型1.0 [30] - 2025年12月,腾讯发布HY-World 1.5 [30] - 2026年1月,蚂蚁集团开源LingBot-World [30] - 2026年4月,腾讯开源HY-World 2.0 [30] - 2026年4月,字节跳动把“多模态交互与世界模型”列为Seed独立研究方向 [30] - 2026年6月,阿里巴巴发布Qwen-RobotWorld [30] 投资困境与结构性难题 - 创业方向未收敛,创业公司高估值,是当下世界模型投资最核心的结构性难题 [34] - 头部创业公司天使轮估值已飙升至过亿美元 [35] - 背景相似、技术路线相似、业务方向相似的创业公司不断新创,同质化严重 [37] - 世界模型Benchmark仍在测试不同维度,尚未形成行业共同认可的比较秩序 [41][42] - 世界模型同时烧模型的钱和交付的钱,出现“双重成本曲线” [41] 世界模型早期赛段与CV赛道对比 - 学术信用是主要的投资依据 [39] - 单点能力被迅速抬升为平台叙事 [39] - 资本共识早于产品共识 [39] - 最终赛道靠商业场景定义,主要应用方向为机器人、自动驾驶、游戏、工业 [39] - 世界模型可能比CV更难产品化:数据闭环昂贵、行动接口碎片化、必须闭环正确 [40] - 世界模型还没有自己的“ImageNet” [41] 技术路线与投资思考 - 必须投资能Scaling的路线 [44] - 世界模型可拆成连续的能力链:状态表征、动力学机制、学习与校验信号、动作耦合 [45][46] - 状态表征层规定了模型的信息预算,决定后续预测能力上限 [51] - 动力学预测层技术路线相对收敛 [55] - 学习与校验信号层与状态表征层是当前差异最大的环节 [61] - 动作耦合层决定世界预测是否进入控制闭环 [67] - 现在还是视频模型的Pre-GPT3时代 [69][71] - LLM从Transformer到GPT-3用了约三年 [70] 综合工程能力竞争 - 世界模型创业跨过关键分水岭,开始成为综合工程能力竞争 [76] - 数据、算力、训练系统和测评等环节彼此相乘,最弱一环决定最终能力上限 [78] - Rhoda的Direct Video-Action(DVA)系统提供具体样本 [79] - Rhoda用100万+互联网视频预训练因果视频模型,再用少量真机轨迹后训练 [79] - Rhoda逆动力学模型仅需约10小时同类本体数据 [80] - Rhoda用“上下文摊销”和“蛙跳推理”提升算力效率 [82] - Rhoda验证放在真实客户任务中:汽车零部件拆包连续自主运行约1.5小时,工业周转箱拆解连续运行160分钟 [83] 资金门槛与资本集中 - 做出Demo、建立公司和活到技术收敛,是三个不同的资金门槛 [88] - 验证型团队资金门槛0.5-1.5亿元 [91] - 独立平台型公司资金门槛4-8亿元 [91] - 前沿全栈公司资金门槛15-30亿元以上 [91] - 10亿元更接近一家独立世界模型公司“活过一个完整技术周期”的最低生存门票 [92] - 累计可调用资本可能达到20亿元 [92] - 全球前沿公司融资规模已迅速进入3亿-10亿美元区间 [96] - World Labs在2024年融资2.3亿美元后,又于2026年宣布10亿美元新融资 [98] - AMI Labs启动即融资10.3亿美元 [98] - General Intuition完成3.2亿美元A轮 [98] - Odyssey完成3.1亿美元B轮 [98] - Decart累计融资超过4.5亿美元 [98] - 2026年前7个月,中国64家“世界模型相关概念”公司中有58家获得融资,共发生105起融资事件 [99] - 种子、天使和泛A轮占77%以上 [99] - 中美从融资金额和连续追投看,资本已明显进入头部集中 [102] - World Labs、AMI Labs、Decart、Odyssey和General Intuition五家公司累计资金下限约33.4亿美元 [102] - World Labs与AMI Labs两家约占68%,前三家约占81% [102] - 极佳视界在2026年3月至6月连续完成三轮融资,累计约35亿元 [102] - 流形空间成立一年完成6轮融资,Pre-A累计接近10亿元 [102] - 逆矩阵在首轮融资后不久又完成超1亿美元种子++轮 [102] 商业价值与平台化路线 - 世界模型主要商业价值大概率率先在自动驾驶、机器人、工业和游戏等垂直闭环中兑现 [107] - 具身智能出现两条通用平台化路线:Physical Intelligence代表的“Scaling路线”和Generalist AI代表的“Learning路线” [109] - Physical Intelligence思路接近大语言模型发展路径,通过Pretraining和Post-training持续提升模型能力 [111] - Generalist AI提出的Physical Prompting更接近GPT-3的In-context Learning [112] - 通用世界模型最后可能只容得下少数平台,大厂胜率更高 [113] - 数据相关服务可能成为非头部公司的第一阶段商业模式 [115] - AI的Physical AI Data Engine在2025年已向客户交付超过15万小时数据 [114] 送水生意:数据、评测与训练基础设施 - 数据基础设施:采集和对齐状态、动作、结果、力觉与失败数据 [119] - 环境与仿真工具:快速构造极端场景和稀缺失败 [119] - 评测:通过隐藏测试、反事实对照、长时回放和闭环任务判断模型能力 [119] 锦秋基金投资布局 - 锦秋基金是国内最早关注并投资世界模型方向的基金之一 [2] - 锦秋基金于2025年投资了物理AI公司Momenta [2] - 2026年7月8日,Momenta正式在港交所挂牌上市,股票代码为“6880”,成为“物理AI第一股” [2] - 锦秋基金于2023年投资了生数科技 [2] - 2026年4月10日,生数科技宣布完成20亿元人民币B轮融资 [2] - 锦秋基金于2025年完成对流形空间天使轮及天使+轮的投资 [2] - 流形空间在不到一年内新增完成4轮融资,Pre-A轮累计融资近10亿元 [2] - 2026年6月流形空间宣布完成新一轮数亿元融资 [2] - 锦秋基金于2026年投资了世界模型公司章鱼动力 [3] - 锦秋基金是星尘智能的A轮、A+轮领投方之一,A++轮投资方之一 [128] - 2026年6月3日,星尘智能完成B轮系列融资,融资总额超10亿元,估值突破百亿元 [128] - 2026年7月15日,星尘智能发布自研第二代具身基座模型Lumo-2 [128]
李飞飞发布 Atlas ,我们重新算了一遍世界模型的投资账 | 锦秋研究
锦秋集·2026-09-03 21:38