TIGON · CVPR 2026
Text-Image Conditioned 3D Generation
CVPR,2026

一句话概述
TIGON 允许用户同时给出视觉样例和文本指令,将像素级外观线索与语义控制结合起来,生成更忠实、更灵活的三维资产。
摘要
高质量三维生成模型通常只依赖一种条件模态:图像条件模型能够保留丰富视觉细节,但容易受到输入视角和歧义影响;文本条件模型具有更强的语义控制能力,却缺少底层外观信息。本文将图文条件三维生成形式化为一个新任务,由视觉样例和文本描述共同定义目标资产。诊断实验发现,即使只对两种单模态预测进行简单后期融合,也能优于任一单独模态,说明二者具有显著互补性。基于这一观察,TIGON 采用相互独立的图像条件与文本条件主干,并通过轻量级跨模态融合进行联合生成。实验表明,图文联合条件能持续提升单模态方法,为灵活且忠实的三维内容生成提供了简洁基线和新的研究方向。
主要贡献
- 将图文条件三维生成系统化定义为多模态生成任务。
- 验证文本语义与图像视觉细节在三维生成中的互补价值。
- 提出采用轻量级跨模态融合的双分支基础架构。
引用
@inproceedings{cen2026textimage,
title={Text-Image Conditioned 3D Generation},
author={Cen, Jiazhong and Fang, Jiemin and Li, Sikuang and Wu, Guanjun and Yang, Chen and Yi, Taoran and Zhou, Zanwei and Bao, Zhikuan and Xie, Lingxi and Shen, Wei and Tian, Qi},
booktitle={CVPR},
year={2026},
doi={10.48550/arXiv.2603.21295}
}