卡内基梅隆大学机器人研究所开源REST3D框架,实现单张图片生成物理稳定的完整3D室内场景。通过场景树结构与CEM优化,消除物体漂浮和穿插,仿真稳定率从8.3%提升至95.8%。适合机器人仿真训练、VR交互、虚拟内容创作,已开放非商用代码,支持实拍和插画输入。
Tags:
市面上单图 3D 重建大多好看但不 “耐撞”,CMU 开源 REST3D,从图片生成无漂浮、无穿插、可直接跑物理仿真的完整室内场景。
当下主流单图 3D 重建工具如 SAM3D、SceneGen,仅追求视觉几何还原,生成的物体普遍悬浮空中、互相穿插,导入 Isaac Gym 等物理引擎后会瞬间崩散,稳定率最低仅 8.3%;而基于资产检索的方案虽物理合理,但物体外观和原图偏差巨大,难以用于还原真实室内空间。
卡内基梅隆大学机器人研究所推出 REST3D 重建框架,首创场景树(Scene Tree) 物理先验结构,通过多智能体 VLM 理解图片物体支撑关系,搭配 CEM 交叉熵物理约束优化,在不破坏原图视觉一致性的前提下消除所有穿模、漂浮问题。Replica 数据集测试中场景物理稳定率提升至 95.8%,碰撞误差几乎归零。输入任意室内实拍图、动漫插画均可输出仿真就绪 3D 资产,原生对接 VR 交互系统,适用于机器人仿真训练、虚拟演播、沉浸式数字内容创作。
相关链接
论文:https://arxiv.org/abs/2605.30338 主页:https://shirleymaxx.github.io/REST3D/ GitHub:https://github.com/ShirleyMaxx/REST3D
论文介绍
REST3D 是 CMU 提出的单图像物理稳定 3D 场景重建全链路框架,核心创新在于将物理支撑逻辑作为重建底层约束,区别于只做视觉拟合的传统方案。整套流程分为三层:多智能体 VLM 构建场景树、基于 SAM3D 完成单物体重建规范化、CEM 物理仿真迭代优化位姿。模型不再仅输出好看的网格,而是生成符合重力、碰撞规则、可直接用于物理引擎交互的完整场景。
论文在 Replica、ScanNet++ 两大室内数据集完成全面对标实验,相较 SAM3D、DigitalCousins 等基线在物理稳定性指标实现数量级提升,配套 Meta Quest Pro VR 交互 Demo 验证落地价值,6 月已完整开放训练、推理全套代码(非商用协议)。
方法概述
REST3D 概览。给定单张 RGB 图像 I,我们的目标是重建一个适用于物理模拟且符合物理合理性的 3D 场景 S。我们的流程包含三个阶段:(1) 场景树构建:首先推断出一个层级化的场景树 T,用于表征场景中的物体及其空间关系;(2) 场景初始化与规范化:获取原始 3D 重建结果 S_raw,并利用场景树引导进行规范化处理,以校正全局朝向并施加粗略的支撑约束,从而得到初始场景 S_cano;以及 (3) 物理约束优化:在物理约束下,通过基于模拟的优化来精细调整物体位姿,最终获得一个在视觉和物理上均保持一致的场景 S。
1. 场景树 Scene Tree 构建
依托 Gemini VLM + 双智能体分割循环:分割 Agent 生成物体 Mask,验证 Agent 迭代修正遮挡区域;推理物体on/hanging/attached三类支撑关系,以地面、墙面、天花板为根搭建层级场景树,记录谁支撑谁,为后续优化提供物理逻辑先验,从根源避免物体错位。
2. 场景初始化与规范化
调用 SAM 3D Objects 对每个物体单独重建网格,统一世界坐标系;根据场景树矫正全局重力方向,粗平移消除竖直漂浮、穿透,完成基础场景规范化,给物理优化提供优质初始解。
3. CEM 物理约束优化(稳定关键)
采用无需梯度的交叉熵优化算法,分局部组 + 全局组两轮迭代:
局部优化:按场景树分组,每组送入 Isaac Gym 仿真采样最优位姿; 全局优化:统一调整全场景布局,平衡原图相似度与物理能量; 能量函数兼顾布局还原、碰撞惩罚、重力稳定三项指标,不会为物理正确大幅改动原图样貌。
4. 完整落地生态
仿真适配:输出场景原生支持 Isaac Gym,一键运行重力、碰撞模拟; VR 交互:接入 Meta Quest Pro,手势推拉、抓取物体符合现实物理规则; 输入兼容:实拍房间、卡通插画、静物油画全部支持重建。
三、实验实测结果
物理稳定率:基线 SAM3D 仅 8.3%,REST3D 达到 95.8%,场景碰撞误差清零;
视觉平衡:相较检索类方案,物体外观、空间布局和原图高度匹配,无失真替换;
仿真表现:同类方法导入重力后物体四散爆炸,REST3D 场景可稳定静置;
场景泛化:真实居家、办公室、教室、二次元室内、静物油画全部兼容;
四、结论
REST3D 填补了单图 3D 重建 “视觉好看但物理失效” 的行业空白,场景树支撑表示、仿真驱动 CEM 优化两大核心创新,真正实现还原原图样貌 + 物理真实可交互双重目标。该框架大幅降低机器人仿真、VR 内容、虚拟数字场景的素材制作门槛,一张普通照片即可产出专业级仿真资产。项目目前采用非商用开源协议,适合高校、科研团队二次开发;局限在于重度依赖 VLM 理解能力、室外场景未充分验证,后续迭代有望进一步降低部署复杂度,是具身 AI 与沉浸式 3D 内容领域极具价值的开源工具。
感谢你看到这里,添加小助手 AIGC_Tech 加入官方 AIGC读者交流群,下方扫码加入 AIGC Studio 星球,获取前沿AI应用、AIGC实践教程、大厂面试经验、AI学习路线以及IT类入门到精通学习资料等,欢迎一起交流学习💗~
没有评论:
发表评论