[控场AI]
· 6 分钟阅读· 3,431 字

本地运行Pixel 3D多视图:8GB显存免费生成高精度3D模型

本地运行Pixel 3D多视图:8GB显存免费生成高精度3D模型

Pixel 3D多视图功能原生集成ComfyUI,消费级GPU可免费生成背面更准确的3D模型。

开源3D生成工具Pixel 3D新增多视图功能,并已原生集成进ComfyUI,让用户能在本地用消费级GPU(最低6-8GB显存)免费生成3D模型。相比单视图模式只能靠算法"脑补"背面,多视图通过上传多角度参考图显著提升了侧面与背面的还原精度。用户可借助Flux 2 Klein模型免费生成多角度视图作为输入,无需付费的转身表生成器。实测对比显示,多视图在背面表现上明显优于单视图,但在建筑物和有机模型上仍有短板,且生成的网格凌乱,需经重拓扑才能投入生产使用。进阶用户可选择Trellis 2版本,获得网格重新纹理化及MeshLab孔洞修复等额外能力。

开源3D生成工具Pixel 3D迎来了多视图(Multi-view)功能,并原生集成进了ComfyUI。这意味着用户可以在自己的电脑上,用消费级GPU免费生成比单视图更精确的3D模型。本文根据Pixel Artistry频道作者Philip的实操教程,梳理完整的安装、生成与优化流程,并分析单视图与多视图的实际差异。

多视图为什么重要

此前Pixel 3D只能基于单张图片推测模型的完整形态——正面还原度不错,但背面完全靠算法"脑补",误差较大。多视图功能允许上传多张不同角度的视图(如角色转身表),让模型在生成时获得真实的空间参考,从而显著提升背面和侧面的准确度。

作者指出,Pixel 3D的多视图推理代码由创作者发布后,KJ与ComfyUI团队完成了原生集成,同时Visual Bruno的Trellis 2仓库也实现了Pixel 3D及其多视图工作流。也就是说,目前存在两条技术路线:ComfyUI原生集成(安装简单)和Trellis 2版本(功能更强但安装步骤更多)。

重拓扑(Retopology)是3D工作流中将高面数、网格混乱的模型重新整理为干净、规则拓扑结构的过程。AI生成的3D模型通常由数十万个无规律分布的三角面组成,难以直接用于动画绑定、游戏引擎或后续雕刻,因此需要手动或借助工具(如ZRemesher、Instant Meshes)将其转换为四边面为主、边流合理的低多边形网格。这一步骤在专业3D制作流程中不可省略,也是当前AI 3D生成工具距离"开箱即用"还有距离的核心原因之一。

安装与模型准备

第一步是把ComfyUI更新到最新版本。桌面版用户进入ComfyUI菜单点击"立即更新"并重启;便携版用户执行update ComfyUI.bat文件即可拉取最新版。

更新完成后,进入模板库的"3D模型"分区,即可看到新加入的"Pixel 3D多视图"工作流模板,点击后工作流会自动打开。模型文件需从Hugging Face上的ComfyUI Pixel 3D页面下载,重点是Pixel 3D多视图的Safe Tensor文件。作者本人主要使用Int8版本的Safe Tensor,此外还需要Trellis形状VAE、纹理VAE以及Deno V3模型,全部放入对应的ComfyUI模型文件夹后重启即可正确加载。

我主要使用Int8的Safe Tensor文件

Safe Tensor(.safetensors)是一种由Hugging Face推出的模型权重存储格式,相较于传统的PyTorch .pt / .bin 格式,它在加载时不执行任意代码,从根本上规避了恶意模型文件的安全风险,同时加载速度更快。Int8量化版本则是将模型权重从32位或16位浮点数压缩为8位整数,在几乎不损失生成质量的前提下,将显存占用减少约50%,使中端消费级GPU(如8-12GB显存)也能运行原本对显存要求更高的模型。

如何获得一致的多视图输入

多视图工作流需要多角度的一致视图作为输入,作者给出了两种方案。

方案一:角色转身表生成器

ComfyUI模板库中自带"角色转身表生成器"(Turnaround),上传一张图片即可生成多角度视图表。不过作者提示,这个生成器每张图消耗约60积分,属于付费方式。

方案二:Flux 2 Klein免费生成

更推荐的免费方案是使用Flux 2 Klein 9B图像编辑模型。在模板库图像分区搜索flux client,下载对应模型后上传原图,通过提示词(如"显示侧视图")分别生成侧视、背视、左视等各个角度,再逐一下载。凑齐四个视图后回到主工作流,禁用(绕过)转身表相关节点组,用加载图像节点导入各视图,并接入去背景节点(RMBG)后插入Pixel 3D多视图条件端口。作者表示会免费提供该工作流,省去手动搭建的步骤。

再次去模板库

显存需求与运行门槛

作者对显存占用做了实测,这也是本地部署最关心的问题:

  • 默认设置(四视图):约需 8~12GB 显存
  • 高设置(全部50步采样 + 高分辨率):约需 12~16GB 显存
  • 绕过纹理化阶段:最低可在 6~8GB 显存上运行

目前尚无GGUF量化版本,作者鼓励用户自行测试更低显存的可行性。对于8GB显存的中端显卡用户来说,这已经是一个相当友好的门槛。

结果优化技巧

默认工作流生成的模型细节并不算多,还时常出现"面片化"外观、面部平滑度不佳或孔洞等问题。作者给出的优化方法与ComfyUI官网建议一致:

  • 更换种子(Seed):这是解决孔洞和异常最直接的办法
  • 提高采样步数至50步:能明显改善纹理质量,之前存在的孔洞会被填补
  • 调整视场角(默认20):Pixel 3D多视图依赖空间中不同相机角度将视图投影到网格上,视场角控制相机布局,对最终网格影响很大,可尝试更高或更低的值

然后我们也可以去这里改变种子

视场角(Field of View,FOV)在3D生成场景中决定了虚拟相机"看到"物体的范围。较小的FOV(如20度)模拟长焦镜头效果,透视畸变低,适合还原物体真实比例;较大的FOV则相当于广角镜头,会引入更多透视变形。Pixel 3D多视图工作流通过将各角度图像"投影"到三维网格上来重建形状,FOV直接影响投影的映射关系——设置不当会导致网格在深度方向上被压缩或拉伸,这也是建筑物测试中屋顶出现变形的潜在原因之一。

单视图与多视图实测对比

作者用同一角色分别跑了单视图和多视图两套流程,并导入Blender对比:

  • 正面表现:单视图反而更贴近参考图,纹理也更好
  • 背面表现:多视图明显更准确,纹理更清晰,因为单视图的背面完全靠算法想象
  • 有机模型(人头):面部细节和比例基本正确,但睫毛被错误地当成了几何体处理
  • 建筑物测试:多视图在建筑上表现不佳,屋顶出现变形,说明输入图像必须真正一致、且要选用正视图角度

作者反复强调,无论哪种方式生成的模型线框都非常凌乱,实际使用前需要重拓扑(Retopology)。

Trellis 2 版本的进阶能力

Visual Bruno的Trellis 2版本安装更复杂,需按官网指南逐步操作,但换来了额外能力。它的工作流带有四个图像节点和批量合并节点,通过设置0度、180度、90度、-90度等相机角度对应各视图。

最实用的是网格纹理化功能:可以拿一个已有的3D模型(甚至是自己修改过的模型)为其重新贴图,前提是模型必须附带材质。此外,Visual Bruno工作流在Blender中提供了更强的UV展开能力,并支持用MeshLab填充孔洞——这正好弥补了ComfyUI原生工作流常见的孔洞缺陷。

你可以在这里上传你的模型

网格纹理化(Mesh Texturing)指的是在已有3D几何体的基础上重新生成或投影表面贴图的过程,区别于从零同时生成形状与纹理。这一功能的实用价值在于:用户可以先在Blender等软件中手动修复生成模型的几何问题(填孔、重拓扑),再将修改后的干净网格送回AI工作流获得高质量纹理,从而将AI的图像理解能力与人工的几何修复能力结合起来。UV展开(UV Unwrapping)则是将三维表面"展平"为二维平面的步骤,是纹理正确贴合模型的前提,Blender对此提供了完善的工具支持。

小结

Pixel 3D多视图的价值在于把"高精度3D生成"这件事拉进了本地免费、消费级显卡可达的范围。它并非完美——面片化、孔洞、有机模型和建筑物的处理都还有明显短板,且成品仍需重拓扑才能投入生产。但对于希望在本地免费探索AI 3D生成的创作者而言,配合Flux 2 Klein的免费视图生成方案与多视图工作流,已经能获得比单视图更可靠的模型结果。

分享:

相关推荐