3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26
量子位·2026-08-14 14:12

核心观点 - 浙江大学ReLER团队提出并开源PhyEdit,用显式3D几何preview指导DiT图像编辑,解决AI在物体远近、尺度、遮挡和多物体操作中的三维空间物理常识错误问题,论文已被ACM MM 2026接收[3] PhyEdit技术方案 - 核心流程分四步:用户给定待操作物体和三维操作指令(移动或6DOF);估计场景深度和相机参数,把物体反投影成三维点云;在3D空间中移动点云,再投影成目标preview;将源图、preview和文本一起交给Qwen-Image-Edit backbone生成最终图像[11] - preview不需要像完整照片,只需清楚表达物体位置、大小和遮挡关系,生成模型可从源图恢复纹理和身份[8] - PhyEdit避开两个极端:既不是让大模型完全靠prompt猜三维空间,也不是把点云投影直接当成最终图像[9] - 在基础flow-matching loss之外加入像素级SILog depth loss,从预测velocity恢复编辑图,再比较编辑图和目标图的深度[10] - 消融结果:不使用深度监督DIoU 62.37、Chamfer 24.52;latent-to-depth方案DIoU 64.19、Chamfer 20.87;pixel-level方案DIoU 65.33、Chamfer 18.93[10] 训练数据集RealManip-40K - 团队构建RealManip-40K,包含41154对真实场景图像,提供深度、物体mask和代表性三维坐标[14] - 数据管线利用3D foundation model的camera token进行聚类,筛选相机近似静止的视频片段,再完成目标检测、跟踪、分割、深度估计和三维位移筛选[15] - RealManip-40K重点覆盖三类难题:明显的远近变化、复杂遮挡以及多个对象同时操作[16] 评估基准ManipEval - 团队构建ManipEval,共200对图像、约320个物体,其中一半为单物体操作,另一半为多物体操作[17] - 从五个层面考察模型:2D落点是否准确;深度是否正确;重建后的三维点云是否接近目标;物体身份和画质是否保留;光照、接触与遮挡是否合理[18][27] - PhyEdit主要成绩:DIoU 65.33、Mask IoU 27.20、Chamfer 18.93、RA-DINO 36.91、Phys-VLM 93.72[21] - 与Nano Banana Pro对比,DIoU提升5.36,Chamfer距离降低6.40,RA-DINO提升2.14[22] - 商业模型常见问题包括:物体仍留在源位置、只操作了多物体指令中的一部分、把目标放到错误深度、在遮挡区域改变物体身份,PhyEdit在大幅移动、小尺寸物体以及多人操作场景中更稳定[24] 连续动作与普通编辑能力 - 给出一条三维轨迹后,PhyEdit在轨迹上的多个位置生成关键状态,再由视频模型插值出中间帧[25] - 机械臂未出现在训练分布中,仍能沿曲线把红笔移动到纸张左下方[26] - 测试改变颜色、材质、图案和添加局部元素等任务,PhyEdit需一次生成同时完成外观编辑与三维操作,综合成功率为87.5%;Qwen-Image-Edit单独完成普通编辑时为88.8%[32] - 两者只差1.3个百分点,但PhyEdit三维精度明显更高,说明加入几何控制没有让基础编辑能力大幅退化[33] 开源与定位 - PhyEdit提供交互式前端GUI,用户可上传图片、分割并选择多个物体,在三维点云中调整平移和旋转,再生成最终图片[35] - 团队定位PhyEdit不是完整physics simulator,不会显式计算受力、碰撞和动力学,透明反光物体、极端近景移动以及严重深度或分割错误仍可能导致失败[35] - PhyEdit解决当动作由用户指定时,如何把一个明确的三维操作渲染成几何合理的视觉状态,为机器人视觉规划、交互式内容和图像状态预测提供可复现的开源起点[35]

3D指标超过Nano Banana Pro!浙大开源方案让AI在平面图像里进行立体编辑 | ACM MM'26 - Reportify