研究愿景与发展路线

以三维智能构建世界模型

我的研究关注机器如何重建、生成并最终模拟连贯的三维环境。整体路线将可靠的空间表示与可扩展生成先验相连接:从神经重建和可编辑场景理解出发,发展预训练三维资产生成,进一步探索面向具身智能的开放式世界模型。

研究方向

世界模型与无限三维世界

生成大规模连续环境,并在世界持续扩展时保持几何和外观一致性。

  • WorldGrow — 基于分层场景块的无限三维场景生成。

预训练与可控三维生成

学习可扩展三维先验,同时提供对外观、语义和可编辑物体结构的控制能力。

  • UniLat3D — 几何外观统一潜变量。
  • TIGON — 图文联合条件三维生成。
  • SCULPT — 基于减法式组合的部件感知生成。

三维重建与空间表示

从稀疏观测恢复高质量、可浏览的三维内容,并让场景表示服务于后续交互任务。

  • GaussianObject — 四视图高斯泼溅重建。
  • NeRFVS — 基于几何脚手架的自由视角合成。
  • SA3D — 神经三维场景中的交互式分割。

动态与医疗空间智能

面向形变场景与复杂手术观测,联合建模几何、运动和可靠性。

  • LerPlane — 可变形组织快速四维重建。
  • EndoGSLAM — 内窥镜稠密重建与跟踪。
  • ForPlane — 高效动态神经表示。

研究路线

  1. 2021–2023 · 表示可靠的神经场景表示。NeRFVS、SA3D 和 LerPlane 分别探索几何先验、交互式理解与高效动态重建。
  2. 2024 · 重建从有限观测恢复高质量三维。GaussianObject 和 EndoGSLAM 将高斯泼溅用于极端稀疏视图与医疗场景。
  3. 2025–2026 · 生成可扩展、可控制的三维先验。UniLat3D、TIGON 和 SCULPT 从统一生成表示进一步发展到多模态控制和可编辑部件。
  4. 2026 起 · 世界模型开放式空间智能。WorldGrow 将生成式三维先验连接到可持续扩展的大规模环境,为未来具身智能体构建世界基础。

开放研究与可复现公平比较

我的大多数代表性项目均公开代码、项目主页和完整论文记录,目标是降低独立复现与公平比较的成本,而不仅仅是展示筛选后的演示结果。

  • 开放实现:SCULPTTIGONUniLat3DWorldGrowGaussianObjectSA3DLerPlane 均提供源代码或可复现研究材料。
  • 可比较证据:稳定的论文页面将方法与论文、DOI 或 arXiv 标识、代码、可用数据或模型、BibTeX 及明确研究关键词相连接。
  • 扎实基线:相关工作覆盖重建、生成、多模态控制、可编辑结构和大规模场景,可沿一条连贯技术路线进行比较。
  • 机器可读记录:完整研究成果提供论文 JSONBibTeXAtom feed研究者档案

这组工作所体现的能力

这组研究为世界模型、三维生成、空间智能、三维重建和具身智能相关研究与工程工作提供了连续证据:不仅包含单篇论文结果,还覆盖问题定义、开放实现、大规模生成与产品落地。

  • 技术深度:工作涵盖神经场景表示、Gaussian splatting、三维生成潜空间、多模态条件、组合式资产与无限世界生成。
  • 研究连续性:从重建与场景理解逐步推进到可控三维生成和基础世界模型。
  • 研究到产品的执行力:先进三维生成技术已落地到消费级创作产品,其中一次产品发布在 50 小时内服务超过 40,000 名用户。
  • 开放评测:公开实现与稳定文献记录使研究者和团队能够直接检查、复现并比较这些工作。

正在探索的问题

  • 基础世界模型如何在长距离空间扩展中保持几何、外观和语义一致?
  • 预训练三维生成模型如何在不牺牲资产质量的前提下提供组合式结构?
  • 重建、生成与模拟能否共享同一种可扩展空间表示?
  • 这些模型如何支持理解、想象并与物理环境交互的具身智能体?