文章核心观点 生成式AI正从生成可观看的内容,转向构建可长期运行、可持续修改、状态一致的三维世界,行业技术瓶颈在于状态维护与响应速度,生境科技通过自主空间智能架构与大规模交互数据,推动世界模型从一次生成走向状态-行动闭环 [3][26][40] 生成式AI进入“造世界”阶段 - AI交付物从文字、图像、视频进入软件、游戏、三维空间与仿真环境,任务从生成可观看内容转向维护状态、模拟变化并规划行动 [3] - 三维场景同时考验语言理解、空间推理、长程编程、工具调用、资产组织和物理执行,任何环节失效可能表现为空场景、对象缺失、穿模或状态丢失 [6] - 模型从“一次性生成”进入持续运行,MiniTown、Material Lab、Voxel Velocity等工作表明借助代码和工具接口,模型可持续组织对象、规则与反馈 [6] - PlayCo的Unity实验中,结构化调用相比直接工具调用减少63.5%的Token总量和50.1%的模型轮次 [5][6] - 场景一旦开始持续运行,状态维护从后台工程问题上升为核心智能问题 [6] 世界模型的两条技术路线 - 感知式路线从像素、视频或视觉Latent生成后续观察,强调真实感、连续性与可漫游体验,代表包括Genie 3、World Labs Marble、Odyssey [24] - 符号化路线生成对象、代码、规则与引擎状态,再执行、渲染和持续修改,代表包括Kimi K3、GPT-5.6/Codex、Fable 5 [25] - 行业关注重点正从“世界如何表示”转向“世界能否持续运行”,未来系统需要让观察、状态、行动与反馈形成闭环 [26] 世界生成的工程链(R-T-V) - R(Representation):描述当前世界的对象、关系与状态 [33] - T(Transition):描述动作发生后世界如何变化 [34] - V(Verification/Value):判断新的状态能否成立并继续运行 [34] - LLM判断“要什么”,专用空间模型计算“放在哪里、如何成立”,状态基础设施负责保存、求解和验证 [35] 技术瓶颈:速度与状态难以维持 - 感知式路线画面逼真但真实尺度、对象身份与遮挡区域缺少稳定约束,镜头转动或离开后尺度可能漂移,视线之外空间逐渐模糊失真 [43] - 符号化路线对象、坐标和代码显式存在,但碰撞、边界、朝向、拓扑与跨对象关系分散在不同脚本中,局部修改后对象可能越界、重叠或破坏原有关系 [45] - 系统缺少一层独立、可验证、可增量更新的世界状态,WorldCoder-Bench、GameCraft-Bench、FloorplanQA、GEST等评测表明代码能运行不代表世界在多轮操作后仍然成立 [47] - 产品体验取决于首次有效结果,World Labs Draft约20秒得到草稿,完整World约需5分钟,高质量Mesh接近1小时,其他完整场景流程普遍在数分钟到数十分钟 [49] - 速度瓶颈不只是生成,而是检查、修复和返工,越依赖整场重算越难进入高频交互 [49] 技术趋势:从一次生成走向状态-行动闭环 - 模型不再直接把自然语言变成最终三维结果,而是在模型与引擎之间加入可计算、可修改、可验证的场景中间表示 [55] - LayoutGPT、Holodeck、AnyHome开始显式组织对象和空间关系,SceneScript、HDSL、The Scene Language、Procedural Scene Programs等把场景变成可寻址、可修改的程序化表示 [56] - 每一次创建、删除、移动和修改成为状态转移,训练数据从“最后生成了什么”扩展到什么行动改变了世界、哪些行动有效 [60] - Hydra、ConceptGraphs、SayPlan、SayNav、VoxPoser等工作把持续感知整理为空间记忆,HiSQ、OptiScene、LayoutVLM、SimWorld Studio等把碰撞、越界、关系失效转化为可诊断反馈 [60] 生境科技:自主空间智能架构 - 生境围绕统一世界状态构建三层核心能力:空间状态模型、空间-行动模型与空间执行引擎 [66] - 状态模型维护对象、几何、关系、约束与历史,行动模型学习目标、动作与未来状态之间的关系,执行引擎负责生成、修改、渲染、验证并将结果写回世界 [66] - 与Coding Agent直接操纵Blender、Unity、UE等工具不同,生境把世界状态交给独立计算系统持续维护,局部修改沿已有世界增量求解,不必反复重建整个场景 [66] - 相关链路已实现约20秒级增量解算 [67] 生境科技:空间场、多模态编码与质量验证 - 生境同时维护离散对象图与连续空间场,前者描述对象、拓扑和关系,后者计算光照、视线、通行、可达性与活动条件 [72] - 相关NSF实验将端到端布局碰撞率降低至2.75% [72] - MST-Builder把图像、户型、商品、3D资产与UGC统一编码为Spatial Token,使语义、几何、关系、来源和版本落到同一套空间状态中 [72] - 验证器将意图一致性、几何合理性、空间可用性与视觉结果转化为可诊断信号 [72] 生境科技:产品即训练环境 - 互联网拥有海量空间图片、视频和三维资产,却很少记录世界为什么发生变化,用户为什么移动、撤回,什么结果最终被保存、分享或放弃 [77] - 生境通过三类产品获取经验:SenBOX提供高密度空间创作、修改与偏好反馈,SenHome引入真实空间、商品、尺寸和生活决策约束,SimHub/API连接产业任务、仿真与机器行动 [77] - 森盒二测形成第一批规模化数据:3,970名用户产生10,704个最终空间状态、15.2万次资产进入真实空间关系、119.4万次空间交互和29.1万次评价反馈 [77] - 更有价值的是其中不断出现的撤回、冲突、局部失败、长期任务和个体偏好,这些长尾轨迹可直接用于训练生成模型、行动模型与验证器 [77] - 静态数据记录世界的结果,交互数据记录世界变化的原因,生境把产品增长转化为模型能力的积累 [78] 生境科技:交互数据栈与产品响应 - 交互式空间产品必须同时满足响应速度、状态稳定与结果准确,后续修改只重算必要区域并写回同一版本 [80] - 速度支持高频尝试,稳定性保证每一轮都发生在同一个世界 [80] - 生境AI-SenHOME产品已实现10秒级响应与稳定状态 [80]
AI造世界,难在第二步
36氪·2026-08-19 21:56