TIGON · CVPR 2026

Text-Image Conditioned 3D Generation

Jiazhong Cen, Jiemin Fang, Sikuang Li, Guanjun Wu, Chen Yang, Taoran Yi, Zanwei Zhou, Zhikuan Bao, Lingxi Xie, Wei Shen, Qi Tian

CVPR, 2026

  • Text-Image Conditioned 3D
  • Multimodal Generation
  • Vision-Language Guidance
TIGON text-image conditioned 3D generation teaser

TL;DR

TIGON lets a user specify both a visual exemplar and a textual instruction, combining pixel-level appearance cues with semantic control to generate more faithful and flexible 3D assets.

Abstract

High-quality 3D generators commonly rely on a single conditioning modality. Image-conditioned systems preserve visual detail but can inherit viewpoint bias and ambiguity, while text-conditioned systems offer broad semantic control without enough low-level appearance information. This work formalizes text-image conditioned 3D generation, in which a visual exemplar and a textual specification jointly define the desired asset. A diagnostic study finds that even late fusion of independently conditioned predictions improves upon either modality alone, demonstrating strong cross-modal complementarity. Building on this observation, TIGON uses separate image- and text-conditioned backbones with lightweight cross-modal fusion. Experiments show that joint conditioning consistently outperforms single-modality alternatives, providing a simple baseline and a practical direction for flexible, faithful 3D content generation.

Key contributions

  • Formalizes text-image conditioned 3D generation as a multimodal generation task.
  • Demonstrates the complementary value of textual semantics and image-aligned visual detail.
  • Introduces a minimalist dual-branch architecture with lightweight cross-modal fusion.

Citation

@inproceedings{cen2026textimage,
  title={Text-Image Conditioned 3D Generation},
  author={Cen, Jiazhong and Fang, Jiemin and Li, Sikuang and Wu, Guanjun and Yang, Chen and Yi, Taoran and Zhou, Zanwei and Bao, Zhikuan and Xie, Lingxi and Shen, Wei and Tian, Qi},
  booktitle={CVPR},
  year={2026},
  doi={10.48550/arXiv.2603.21295}
}