韩国CLO Virtual Fashion公司研发出衣服薄薄一层结构3D生成技术 这项由韩国CLO Virtual Fashion公司研发团队完成的研究以arXiv预印本形式发布于2026年7月15日编号为arXiv:2607.13365。有兴趣深入了解技术细节的读者可通过该编号查询完整论文。**现实中的一道难题**你有没有想过为什么网上买的衣服试穿时总是和商品图有那么大的差异部分原因就在于数字世界里真实还原一件衣服的立体形态比你以为的要难得多。现在的3D建模技术就像是用大量积木堆出一件衣服的样子——但衣服本身是薄薄的一层布料而积木天然是有体积的方块。用方块去堆一张纸结果要么是纸变得厚实笨重要么边缘锯齿感明显完全失去了薄如蝉翼的轻盈感。主流的3D生成技术绕不开这个根本矛盾它们天生就擅长生成封闭的、有厚度的物体比如一个苹果、一辆汽车但面对衬衫的领口、裙子的荷叶边、夹克的拉链这类薄薄的、边缘开放的结构时就力不从心了。CLO Virtual Fashion的研究团队把这个问题彻底翻新了一遍提出了一套叫做可微分几何图像DiffGIDifferentiable Geometry Image的方法专门为薄壳结构量身定制让计算机第一次能够以接近人类裁缝理解布料的方式来生成和还原3D服装。---一、为什么现有技术面对衣服总是碰壁回到积木的比喻。主流3D生成技术的核心思路是把整个三维空间切成无数个小格子就像一个立体的棋盘然后判断每个小格子里有没有物体。这种方法对苹果、椅子、雕塑这类实心物体效果很好因为物体本身就有体积能填满那些格子。但衬衫不是苹果。衬衫是一张弯曲的、开放边界的薄面厚度接近于零。当你用立体棋盘去描述衬衫时就相当于用方格纸去剪一个圆——边缘永远是一圈锯齿而不是光滑的曲线。分辨率越低锯齿越明显。很多技术不得不把分辨率提得非常高比如一种叫GIMDiffusion的方法需要用768×768的网格才能勉强压制锯齿但这样计算量就大得惊人。更根本的问题在于这些技术的边界判断是一刀切的一个格子要么是有要么是没有没有中间状态。这就好比你用黑白两色的马赛克去拼一幅画颜色只有纯黑和纯白却要表达灰色渐变的头发——无论怎么努力结果都是粗糙的。当系统需要把高分辨率的黑白图压缩成小图来加速训练时灰色的边界信息就彻底丢失了。还有一个更隐蔽的问题就算技术能生成一个粗糙的3D形状最终从数字信号翻译成真正的3D网格模型这一步也是硬切的、不可逆的就像把一张手绘稿扫描进电脑之后电脑无法再反过来修改铅笔线条。这导致整个学习过程是断链的——AI在学习时无法从3D结果的好坏反过来调整自己的判断。---二、新思路用距离感代替有或没有DiffGI的核心突破是把描述边界的方式从是/否换成了距离。具体来说研究团队不再用0或1的黑白格子来标记衣服的轮廓而是给每个格子赋予一个数字这个数字代表离最近的轮廓线有多远。在衣服内部这个数字是正数代表距离边界的像素数量在衣服外部这个数字是负数恰好在边界上这个数字就是0。这种表示方法有一个学术名字叫截断有符号距离函数TSDFTruncated Signed Distance Function但理解它的关键只是一件事连续的数字比硬切的黑白格子能保留多得多的信息。可以这样理解这种区别用黑白格子描述边界就像告诉你这里有一扇门你只知道门在大概这个位置用距离数字描述边界就像告诉你门框的左侧距离你3厘米精度精确到厘米级甚至毫米级。这种精度上的提升有多显著研究团队做了一个对比实验在不压缩的情况下当分辨率低至64×64时TSDF方式的重建误差用豪斯多夫距离衡量明显低于黑白格子方式到了128×128时差距依然显著。只有当分辨率提高到256×256以上两种方式才逐渐趋近。换句话说用距离数字来描述边界可以用更低的分辨率达到更高的重建质量——这直接意味着更少的计算量、更快的速度。对于服装这类边界复杂的物体TSDF的优势更加突出。衣服有密集的褶皱、弯曲的下摆、不规则的开口这些地方边界极度密集。黑白格子遇到这种复杂边界就会产生大量锯齿而距离数字在相邻格子之间平滑过渡天然适合描述这种弯曲绵延的轮廓。---三、让3D重建也能学习可微分的马奇方块算法解决了怎么描述形状的问题DiffGI面对的下一个挑战是怎么让AI从这个描述中把真正的3D网格搭建出来同时让这个搭建过程能够被指导和纠错传统的方法——无论是从3D格子里提取面片的Marching Cubes还是类似的2D版本——都是用查表的方式工作的。给定几个格子的值查一张预设的规则表决定在哪里放一条线或一个面。这种查表操作本质上是跳跃式的、不连续的就像走楼梯而不是走坡道你无法在楼梯上找到半步自然也就无法把楼梯走得好不好这个评价传递回去告诉腿该怎么迈。DiffGI引入了可微分马奇方块DMSDifferentiable Marching Squares算法把这个过程改成了坡道。具体原理是这样的当两个相邻格子里一个距离值是正数一个是负数说明边界就在它们之间。边界的精确位置可以用两个格子的数值按比例插值来计算。比如左边格子的距离是3右边是-1那么边界就在离左边格子75%、离右边格子25%的地方。这是一个连续、平滑的数学运算没有任何跳跃就像走坡道一样。为了防止两个格子数值非常接近时分母趋近于零计算出现不稳定研究团队还加入了一个极小的稳定常数约百万分之一来保护计算精度同时确保这个常数不干扰反向传播时的梯度流动。有了这个连续的坡道AI在训练时就可以做到先从2D的距离图生成3D网格然后把这个3D网格的好坏比如表面法线是否准确、形状是否忠实换算成一个评分再把这个评分通过数学链条一路追溯回去告诉2D图上每一个数字该往哪个方向调整。这就像一个厨师不仅能品尝到菜是否好吃还能精确知道少放了多少盐、火候差了几分钟从而不断改进。研究团队还考虑了一个特殊情况在马奇方块算法的16种拓扑形态中有两种对角格子的值一正一负的情形在数学上存在歧义——两种连法都说得通。团队的做法是统一规定把这两块当作互不相连的独立区域处理虽然选择本身是固定的但选择后边界顶点的坐标依然是连续计算的所以梯度依然能够正常流动。从计算效率上看这个方法工作在2D网格上计算量随格子数量的平方增长而传统的3D体积方法计算量随立方增长。以相同的精度要求DMS大约比DMTet等3D方法快得多内存占用也显著更少。---四、把复杂3D服装压缩进一张名片大小的密码有了连续的距离图和可微分的重建算法研究团队开始搭建整个生成系统的核心——DiffGI-VAE。VAE变分自编码器是一种特殊的神经网络可以把复杂的信息压缩成一段简短的密码也可以从密码重新展开还原信息。这个思路有点像把一部长篇小说压缩成几百字的内容简介然后再从简介反推出故事细节——当然这种还原不可能完美但如果密码设计得足够聪明关键信息是可以保留下来的。DiffGI的输入是一个256×256×4的图像张量三个通道存3D坐标一个通道存距离值目标是把它压缩成32×32×4的潜在表示——也就是把信息压缩到原来的八分之一分辨率。这是极为激进的压缩相当于把一张高清照片缩成略缩图然后要求从略缩图还原高清细节。为了让这个高度压缩的密码仍然保留3D形状的精华研究团队设计了一个三管齐下的损失函数可以理解为评分系统。第一管是位置图的像素级误差确保每个像素的3D坐标大体正确第二管是距离图的像素级误差确保边界信息被正确还原第三管是最关键也最有创新性的——法线渲染损失。所谓法线是3D表面上每个点朝向哪里的信息。如果你把一件衬衫看成是无数个微小平面的集合每个小平面都有一个朝向这就是法线。法线信息对视觉质量至关重要同样形状的表面法线正确的话看起来就是光滑流畅的布料法线混乱的话就会呈现出奇怪的噪点和折痕。传统的像素级损失无法有效监督法线——就算每个像素的坐标都差不多对相邻像素之间微小的错位也可能导致局部法线严重扭曲产生肉眼可见的噪点。法线渲染损失的做法是把重建出的3D网格从四个固定角度渲染成法线图再与真实网格的法线图比较差异把差异换算成损失信号通过可微分的马奇方块算法一路追溯回去影响VAE的权重更新。这条路径的成立完全依赖于DMS提供的连续可微分通道。为了加速训练研究团队还采用了一个聪明的起跑策略用已经在海量自然图片上训练好的Stable Diffusion 1.5的VAE权重来初始化同时把第一层卷积的通道数扩展以适应4通道输入新增的权重用零初始化以防止已有知识被破坏。消融实验证明这个预训练初始化只是加速了收敛过程最终的重建质量与从头训练相比几乎没有区别——说明DiffGI的性能提升真正来自于表示方法和训练目标的设计而不是借了预训练的东风。---五、在密码空间里学会创造新服装有了把3D服装压缩成32×32×4密码的能力研究团队的下一步是训练一个能在这个密码空间里创作的生成模型——也就是从无到有或者根据一张图片、一个草图生成全新的3D服装。这类生成模型的主流架构之一叫做扩散模型Diffusion Model它先往真实数据里逐步加噪声把真实变成随机乱码然后反过来学习从乱码恢复真实的过程。训练完成后就可以从纯随机乱码出发一步步去噪最终生成新的真实密码再解码还原成3D网格。研究团队没有使用常见的U-Net架构而是选择了Diffusion TransformerDiT作为核心骨架。这个选择背后有一个理由服装的UV图把3D表面展开成2D平铺图不像自然图片那样有明显的局部空间规律——相距很远的两块布料在展开图上可能紧挨着而在展开图上相邻的两块区域在3D空间里可能完全不相干。Transformer架构能让所有位置两两之间互相对话非常适合捕捉这种全局拓扑关系。此外扩散模型采用了流匹配Flow Matching调度方案这种方案能用更少的去噪步骤生成高质量结果进一步加快推理速度。研究团队基于这套框架搭建了三种不同的生成模式分别服务于不同的使用场景。第一种是类别条件生成给AI一个类别标签比如椅子或台灯它就能生成对应的3D模型。这种模式使用了DiT-B/2中等规模架构在ABO家具数据集上训练涵盖椅子、台灯、沙发、桌子四类。第二种是图片条件生成给AI一张衣服的正面照片渲染的法线图它能推断出看不见的背面生成完整的3D服装。这种模式使用了更大的DiT-L/2架构并通过一种叫DINOv2-Large的视觉特征提取器把图片信息注入到生成过程中。令人惊喜的是尽管训练时用的是渲染法线图在测试时用真实衣服照片也能工作表现出一定的泛化能力。第三种是占位条件生成给AI一张2D的缝纫版型轮廓图相当于裁缝的裁剪样板AI就能生成穿着在身上的3D褶皱效果。由于版型本身已经高度约束了形状研究团队换用了更轻量的UNet-Tiny架构计算量大幅降低。更有趣的是如果你在版型上只修改袖子部分生成出的3D模型也只有袖子部分发生变化其余形态保持一致实现了精准的局部编辑效果。为了解决UV展开图布局固定导致的位置偏差问题研究团队还设计了一套数据增强方法把同一个3D网格重新排列成不同的2D布局这样一件衣服就能变成多种不同的训练样本。在ABO数据集的3800个样本基础上通过这种方式扩充到了50万个训练样本足以支撑更大规模的模型稳定训练。---六、实验数据说明了什么研究团队在两个数据集上进行了系统评估ABO数据集包含约7900个商业3D家具扫描模型椅子、台灯、沙发、桌子等GarmageSet数据集包含约14801个物理仿真级别的3D服装模型具有大量非流形特征。另外还用了约300张真实服装照片的WARDROBE数据集做零样本泛化测试但这个数据集不参与定量评测。定量评测使用了多个指标。倒角距离CD衡量生成形状与真实形状之间的整体差距法线一致性NC衡量表面朝向的准确程度F1分数衡量形状的精确率和召回率边界倒角距离BCD专门衡量开放边界的精确程度这是衡量薄壳结构最直接的指标豪斯多夫距离HD衡量最坏情况下的局部偏差。在VAE重建质量方面DiffGI与两个基线方法进行比较Omages直接在64×64×4的几何图像上操作不经过VAE压缩GarmageNet使用逐面板的几何图像因此无法应用于家具数据集。结果显示DiffGI用32×32×4的压缩密码在家具和服装两个数据集上的倒角距离和地球移动距离EMD等指标均优于Omages直接操作64×64×4不压缩的版本。换句话说DiffGI把信息压得更小表现却更好。唯一的例外是在ABO家具数据集上的法线一致性DiffGI的NC略低于Omages研究团队认为这是因为家具形状多为平面Omages不压缩直接保留了更多法线细节而在服装这类复杂曲面上DiffGI的NC反而更高。消融实验逐步关闭各个设计组件观察性能变化清晰地展示了每个设计决策的贡献。单纯把占位图换成TSDF不加法线损失倒角距离就从1.503×10??降到0.595×10??降幅超过六成这是表示方法本身带来的收益。在此基础上加入法线损失倒角距离进一步降至0.461×10??法线一致性从0.921升至0.961。有一个有趣的细节仅用占位图法线损失组合法线一致性能达到0.947超过了TSDF无法线损失的0.921——这说明法线损失足够强力能在一定程度上弥补占位图的边界模糊问题但在倒角距离、地球移动距离等整体形状指标上TSDF无法线损失仍然领先于占位图法线损失证明表示方法是更基础性的因素。在3D生成任务上与TRELLIS、TRELLIS.2等大型基础模型的对比显示DiffGI在服装生成的精确度上更胜一筹——倒角距离1.35×10??对比TRELLIS的3.44×10??F1分数0.48对比TRELLIS的0.28边界倒角距离2.91×10??远低于TRELLIS.2的12.44×10??同时顶点数量只有约2.3万而TRELLIS有10.9万、TRELLIS.2有38万。当然TRELLIS是通用大模型DiffGI是专为服装优化的专项模型两者的定位不同研究团队也明确表示这个对比的目的是展示薄壳结构专用方案的优势而非声称全面超越。TRELLIS在服装生成上产生的常见问题是双层壁——前后两层布料被当成了封闭物体中间生成了不合理的厚度这是所有假设封闭表面的方法的根本缺陷。计算效率方面的对比相当惊人。TRELLIS推理一次需要约16.28GB显存、4.52秒Omages需要52秒。DiffGI的图片条件生成版本在RTX A6000上只需3.22GB显存、0.80秒在消费级的RTX 4070显卡12GB上需要1.21秒甚至在苹果M4芯片的MacBook上纯CPU运行也只需8.52秒。这意味着DiffGI已经可以在没有专业显卡的普通笔记本上运行。---七、这套方法还不完美的地方DiffGI的局限性主要体现在三个方面研究团队在论文中坦诚地进行了说明。第一TSDF的线性插值在极度尖锐的棱角处会产生轻微的圆角效果。对于衣服来说这几乎不是问题因为布料本来就是柔软的曲面但如果用来还原机械零件那种硬朗的直角就可能有些失真。第二当前框架只生成几何形状不生成颜色纹理或材质属性。一件3D服装只有光秃秃的灰色网格没有花纹、颜色或布料材质在实际应用中还需要单独的纹理生成步骤。第三不同UV分片之间的边界缝合问题。DiffGI把一件衣服分成多个UV图块分别处理每个图块之间是独立重建的没有强制约束相邻图块在3D空间里的接缝要完美对齐。这种缝合不齐的问题不影响几何评测指标但在进行物理仿真时比如模拟衣服在风中飘动接缝处的不连续会造成破绽。针对这些问题研究团队也提出了未来的改进方向引入能保持尖锐边缘的等值面提取算法如对偶轮廓化来处理棱角问题扩展潜在空间以同时生成高分辨率纹理和材质图设计两阶段流程先生成2D版型布局再从版型重建3D形状以支持更精细的服装设计控制。---说到底DiffGI做的事情是把一个长期困扰数字服装领域的根本性问题——怎么让AI真正理解薄薄一层布料——换了一套思路来解决。不是靠堆砌更大的模型、更高的分辨率、更强的算力而是从表示方法这个最基础的层面做改变用连续的距离数字代替非此即彼的格子标记用可微分的坡道代替不可逆的阶梯跳跃让整个从2D信息到3D形状的过程变成一个可以双向传导、可以学习优化的闭合回路。这项改变的影响对普通人来说可能是你在网上看到的虚拟试衣、游戏里的服装系统、影视特效里的布料飘动都有机会变得更真实、更细腻而支撑这些效果的计算机也许只需要一台普通的笔记本就够了。当然从研究室里的技术突破到大规模商业落地还有相当长的路要走但这一步的方向是清晰的。有兴趣深入了解技术细节的读者可以通过arXiv:2607.13365查阅完整论文。---QAQ1DiffGI和普通3D建模软件有什么区别A普通3D建模软件需要人手工逐步雕刻形状DiffGI是一套AI自动生成系统输入一张照片或轮廓草图几秒钟内就能自动生成完整的3D服装网格。最大的不同在于DiffGI专门为薄壳结构比如衣服设计能生成开放边界、不封闭的薄面结构而传统3D生成AI往往只会生成有厚度的密封体把衣服做成两层厚壳。Q2TSDF截断有符号距离函数为什么比黑白占位图更好用于服装建模A黑白占位图对每个格子只有有或没有两种状态边界只能落在格子边上分辨率不够高时边界就像锯齿TSDF给每个格子存储一个到最近边界的距离数值边界位置可以在两个格子之间的任意位置精确插值不受格子分辨率限制。对于服装这类边界密集、弯曲复杂的对象TSDF能在低得多的分辨率下达到同样或更好的精度大幅减少计算量。Q3DiffGI生成的服装3D模型能直接用于物理仿真或游戏引擎吗A目前有一定限制。DiffGI生成的是标准三角网格且因为采用多图块UV展开不同图块之间的边界接缝在3D空间里可能存在微小不连续会影响物理仿真的准确性。此外当前版本不生成颜色纹理只有几何形状。研究团队已将跨图块边界一致性约束和纹理生成列为后续工作方向。作为快速原型参考或静态渲染当前版本已经足够实用。

本月热点