‹ 返回 2026-06-21

JanusMesh:通过跨空间去噪技术实现快速且无需样本训练的3D视觉幻象生成

JanusMesh: Fast and Zero-Shot 3D Visual Illusion Generation via Cross-Space Denoising

▲ 17 💬 2 2026-06-21

Siang-Ling Zhang, Huai-Hsun Cheng, Tsung-Ju Yang, Yu-Lun Liu

摘要

创建3D视觉错觉效果,即从一个3D网格中通过不同视角观察来呈现完全不同的语义内容,是一项具有挑战性但引人入胜的任务。现有的基于优化的方法效率较低,且容易导致颜色过饱和问题。而简单的拼接方法则无法生成几何结构连贯的物体,从而会产生不自然的接缝和语义信息泄露现象。本文提出了一种快速且无需训练的框架,用于生成由文本驱动的3D视觉错觉效果。我们的方法将生成过程分为两个阶段:首先,我们采用了跨空间双分支去噪算法,该算法能够将3D latent数据动态转换为体素空间,从而实现CLIP引导下的方向对齐和Signed Distance Field的融合,确保几何结构的无缝结合;其次,我们引入了基于视角的纹理合成模块,将特定视角的2D扩散先验信息整合到融合后的几何结构中。大量实验表明,我们的方法能够在3-5分钟内生成高度真实的、具有双重语义的3D视觉错觉效果。在几何结构完整性、语义可识别性和效率方面,我们的方法均优于现有方法。项目页面:https://siang1105.github.io/JanusMesh.github.io/

English Abstract

Creating 3D visual illusions, a single 3D mesh that reveals entirely different semantics from various viewing angles, is a fascinating but tough challenge. Existing optimization-based methods are slow and can produce oversaturated colors. In contrast, naive stitching approaches fail to produce geometrically coherent objects. This results in visible unnatural seams and semantic leaks. In this paper, we present a fast and training-free framework for generating text-driven 3D visual illusions. Our approach decouples the generation into two stages. First, we propose a cross-space dual-branch denoising process. This process dynamically decodes 3D latents into voxel space for CLIP-guided orientation alignment and Signed Distance Field (SDF) blending, which ensures seamless geometric fusion. Second, we introduce a view-conditioned texture synthesis module that projects and aggregates view-specific 2D diffusion priors onto the fused geometry. Extensive experiments demonstrate that our method generates highly realistic, dual-semantic 3D illusions in just 3-5 minutes. It significantly outperforms existing methods in geometric integrity, semantic recognizability, and efficiency. Project page: https://siang1105.github.io/JanusMesh.github.io/