港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻?
机器之心·2026-08-26 19:02

核心观点 - 香港科技大学(广州)联合腾讯AI平台部提出了VibeWorlding,一个通过多轮对话和工具调用自主构建交互式3D世界的多模态智能体框架,旨在将“Vibe Coding”模式复现到3D世界构建领域[1] - 该框架包含评测基准VWE-Bench、训练框架VibeWorlding-Gym和模型合集VibeWorlder,并开源了6828条多模态用户query、2616个高质量3D资产、323个人工标注种子世界及沙盒环境[6] - 经过强化学习后训练的开源模型VibeWorlder-30B-A3B在综合Pass@1指标上以59.3%反超GPT-5.5的57.3%和Qwen3.8-Max的56.9%,成为该任务表现最好的模型[6][22] 行业背景与问题 - 游戏关卡、数字孪生、具身智能仿真环境等场景依赖大量可交互、可编辑的3D世界,但传统人工搭建效率极低[9] - 现有AI智能体自动化构建工作普遍存在两个问题:评测查询过于理想化和简单,难以反映真实用户模糊不清的表达;几乎所有框架都不开源,学界无法公平对比或系统研究训练效果[9] - 一个可行的3D世界需要“物理上站得住”(不悬空、不穿模)和“语义上说得通”(符合用户意图、风格协调),多维度的正确性仅靠人工规则或通用LLM裁判难以兼顾[9] VibeWorlding框架构成 - 任务形式化为多轮、多模态、工具集成的推理过程:给定多模态请求,智能体需推断用户意图、规划布局、调用3D工具(检索/添加/旋转/平移/删除),并观察沙盒返回的多模态反馈(3D地图文本+五视角渲染图),循环直至产出完整交互式3D世界[11] - 框架包含三大组件:Code(沙盒环境与训练框架)在GitHub开源,Dataset(VWE-Bench评测基准)在Hugging Face开源,Model(VibeWorlder模型合集)在Hugging Face开源[12] - 现有工作分为固定工作流(如SceneCraft、3D-GPT,拆分为规划-生成-评审流水线)和自主智能体(如SAGE、SceneWeaver,封装工具集让智能体自主决策)两条路线[13] VWE-Bench评测基准 - 覆盖2616个高质量3D资产、323个人工标注种子世界、6828条逆向合成用户查询,区分“有标准答案可验证”与“开放式需靠规则打分”两类任务[20] - 构建分三步:第一步,美术标注员确定3148个概念3D资产,用Gemini 3.1-flash-image生成参考图,再用腾讯混元3D(Hunyuan3D 3.1)转成3D网格,经质量过滤后沉淀2616个跨越20个语义类别的资产[20] - 第二步,专业美术用这批资产手工搭建323个种子世界,资产数量从8个到258个不等,覆盖不同复杂度[20] - 第三步,让MLLM“倒着看”种子世界,写出从零构建描述、挑毛病给建议、或扰动资产后描述变化,从而拿到精确标准答案的编辑指令[20] - 最终沉淀六大类查询,其中“精确资产级编辑”类归为Verified(可验证),其余五类(模糊表达、场景批判、引导、重申、复杂场景描述)归为Unverified(不可验证),由Rubric由MLLM裁判打分[15] 双重约束验证器 - 物理可行性验证:用纯Python几何检测碰撞(物体不能互相穿模)和高度(物体不能悬空),不依赖任何模型判断[21] - 意图满足验证:由MLLM裁判从生态合理性、3D理解、3D推理、检索合理性四个维度综合评估[21] - 对于Unverified查询,物理可行性和四个意图维度全部通过才算成功;对于Verified查询,直接和Ground-truth地图比对,按正确编辑的3D资产比例打分[17] - 训练管线先用Gemini 3.1-pro反向合成冷启动SFT轨迹,再用GRPO算法在双重约束验证器提供的奖励信号下做多模态强化学习,让智能体从“纯文本从零构建”和“多模态图文编辑”两类任务中联合学习[17] 实验结果与能力拆解 - 现有模型远未解决该任务:GPT-5.5和Qwen3.8-Max整体Pass@1不到60%,未经训练的开源基座Qwen3-VL-8B和30B-A3B分别只有5.3%和13.6%[22] - 多模态强化学习显著缩小差距:30B-A3B模型从基座13.6%提升到冷启动SFT后34.5%,再到强化学习后59.3%;8B模型从近乎不可用提升到41.4%[22] - 旗舰模型VibeWorlder-30B-A3B以59.3%整体Pass@1超过GPT-5.5(57.3%)和Qwen3.8-Max(56.9%),在Verified赛道上优势更明显(64.5% vs. GPT-5.5的60.4%);VibeWorlder-8B(41.4%)追平Gemini 3.1-pro(42.7%),在Verified赛道反超(59.3% vs. 44.4%)[22] - 六维能力拆解显示:碰撞无冲突是所有模型共同的瓶颈,即便经过RL训练通过率也只有59%~68%;强化学习对3D推理能力提升最显著,从6%~20%跃升到56%~85%,VibeWorlder-30B-A3B达到85%超过Gemini 3.1-pro的62%;检索能力被提升到91%~99%,超过前沿闭源模型[23] - 强化学习让模型“看懂”场景、“找对”资产的能力大幅跃升,但精确空间操控能力(将资产摆到不产生碰撞的位置)仍是所有模型共同的天花板[23] 典型失败模式 - 第一类,不精确的3D距离编辑——方向反了:用户要求岩石“向前移动7米”,模型准确算出了位移量级却把方向搞反,产生14米位置误差,是坐标系理解错误[30] - 第二类,过度编辑——顺手删了不该删的东西:用户只要求“在箱子旁边加一棵树”,模型正确添加新树,却“顺手”删掉了场景里原有的一棵大树,工具执行阶段对“哪些元素不该动”的状态保持能力不足[30] - 两个案例共同指向:多模态智能体在语义理解上已相当成熟,但在精确空间执行与跨轮状态保持上仍有明显短板[25] 真实可用原型与场景 - 团队提供命令行交互原型,配上浏览器端实时3D渲染视图,用户输入自然语言指令,Agent思考、调用工具、执行编辑,浏览器同步刷新[27] - 场景一:从零造农场,用户输入“Create a simple farm with a barn, crop fields, fences, and a few trees”,Agent从空地图开始检索资产,规划三区布局,中途根据渲染图自我修正(调低栅栏高度、缩小树冠)[27] - 场景二:编辑已有城市,用户说“Remove the car in the middle of the road and delete the two green buildings”,Agent枚举场景中摩天楼、军事建筑等,精确定位目标,连发三次删除调用,再渲染多视角确认“只删掉该删的”,最后用自然语言总结改动[28] 未来挑战与方向 - 工具还太“原子化”:目前只提供检索、增、删、平移、旋转等底层操作,未来需要更高级可组合的技能(如“直接铺一个足球场”“在矩形区域内随机撒一片森林”)[38] - 场景规模仍偏小:VWE-Bench中最复杂世界只有258种3D资产,真正开放式世界构建需要更大规模场景,可能靠多智能体协同分工实现[38] - 结果导向的奖励仍然稀疏:当前RL训练用整条轨迹打一个结果奖励,未来引入更细粒度的过程级信用分配(如具体告诉模型是哪一轮发生碰撞)可能让训练更高效[38] - 数据来源与美术风格有限:当前3D资产库偏卡通风格,未覆盖“以图生世界”“以视频生世界”等更丰富的多模态设定[38] - 更深层挑战:即便有了完整多模态反馈闭环,精确空间推理能力(距离、角度等量化空间关系)仍是所有MLLM的共性短板,可能最终需要从预训练/中训练阶段注入更多3D空间数据[33][34]

港科大(广州)联合腾讯AI平台部开源VibeWorlding,3D世界构建迎来Vibe Coding时刻? - Reportify