
一个仓库跑通文生图、图生视频与3D资产Stability AI generative-models 完整本地教程【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-modelsgenerative-models 是 Stability AI 的官方生成模型仓库SDXL 文生图、SVD 图生视频、SV3D 多视角3D、SV4D 4D资产生成全部可以在本地跑起来。这篇教程带你从零走通「选模型 → 下权重 → 跑 demo → 验结果」的完整闭环。1. 先认识这个仓库你拿到的是什么上手前花两分钟看目录比背命令更重要。这个仓库的核心思路是配置驱动模型、采样器、损失函数都是独立模块靠 YAML 配置拼起来。目录作用sgm/核心代码DiffusionEngine、采样器、引导器、编码器configs/推理与训练配置比如 configs/inference/sd_xl_base.yamlscripts/demo/Streamlit / Gradio 网页 demo适合随手试scripts/sampling/独立采样脚本一条命令出结果checkpoints/自建目录所有模型权重统一放这里一个实用认知权重不在仓库里。仓库本身只有代码和配置几 GB 的模型文件需要单独下载放进checkpoints/。想清楚这一点后面所有步骤就顺了。2. 想生成什么先按场景对号入座这个仓库支持的模型很多但新手只需按「想要的效果」来选不用记型号。你的目标对应模型输入输出文字生成图片SDXL base可选 refiner 精修或 SDXL-Turbo一句提示词图片静图变成视频SVD / SVD-XT一张图14 / 25 帧视频静图转3D环绕视频SV3D_u / SV3D_p一张图白底单物体最佳21 帧环绕视频视频转4D新视角SV4D / SV4D 2.0一段短视频多角度新视角视频训练自己的模型sgm 训练配置数据集微调/新模型新手建议按 SDXL → SVD/SV3D → SV4D 的顺序来前两者输入简单、出图快第三个才涉及视频输入和多视角合成。3. 下载路径三条路推荐一条模型权重托管在 Hugging Face 官方页面搜索stabilityai即可找到 SDXL、SVD、SV3D、SV4D 各家的模型页。三条路网页手动下载登录、接受协议、点 Files、逐个下载。直观但慢断了就重头来不推荐大文件。huggingface-cli命令行下载推荐支持断点续传、可以只挑需要的文件。网页 脚本混用小文件手动下大文件走命令行。推荐路径就是第 2 条两步装好工具pip install huggingface_hub huggingface-cli download stabilityai/sv4d2.0 sv4d2.safetensors --local-dir checkpoints上面这条命令的含义把 SV4D 2.0 的权重文件下载、直接落到checkpoints/目录。把仓库名和文件名换成你自己的目标模型即可例如 SVD、SV3D 的对应 safetensors。4. 最小环境四步命令搭好地基环境不用追求全家桶能跑推理的最小组合如下git clone https://gitcode.com/GitHub_Trending/ge/generative-models cd generative-models python3.10 -m venv .generativemodels source .generativemodels/bin/activate接着装依赖注意 CUDA 版本要与显卡驱动匹配官方验证的是 cu118pip3 install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118 pip3 install -r requirements/pt2.txt pip3 install .三点提醒Python 建议 3.10。官方只在此版本下完整验证过其他版本可能出现依赖冲突。最后一条pip3 install .是把 sgm/ 安装为可导入的包推理和训练都需要。sdata数据管道只在训练时才需要装纯推理直接跳过。5. 实操一让 SDXL 在自己电脑上出第一张图目标文字 → 图片。这是最常用的场景也配有网页界面出错时好排查。下权重从 Hugging Face 的stable-diffusion-xl-base-1.0模型页下载权重放进checkpoints/。refiner 可选想要更精细的细节再下。跑 demostreamlit run scripts/demo/sampling.py浏览器打开后输入提示词、设置步数和引导系数出图。想要更快可以改用 SDXL-Turbo。权重放入checkpoints/后运行streamlit run scripts/demo/turbo.py它靠对抗蒸馏把采样步数压到极少出图几乎是即时的适合反复调 prompt。后台机制不用深究demo 内部读取 configs/inference/sd_xl_base.yaml 这类配置来实例化模型改采样步数、调度器等都是在配置层面操作不动代码。6. 实操二一张静图生成环绕视频目标图片 → 视频。这一步只需一个脚本scripts/sampling/simple_video_sample.py。先下载 SV3D_u 权重到checkpoints/sv3d_u.safetensors然后python scripts/sampling/simple_video_sample.py \ --input_path assets/test_image.png --version sv3d_u输入直接可以换成仓库里自带的示例图几个高频参数--version sv3d_p换用 SV3D_p可指定相机路径--elevations_deg、--azimuths_deg做动态轨道视频输入是白底单物体图时效果最稳普通照片可用--remove_bgTrue先抠背景SVD 系列同理下好svd/svd_xt权重后同一脚本传--version svd或svd_xt分别得到 14 帧和 25 帧视频想交互体验可以起网页版python -m scripts.demo.gradio_appSVD或streamlit run scripts/demo/video_sampling.py。7. 验证结果三个确认点下载完权重、跑完 demo 后别直接开用花一分钟确认三件事权重完整性。README 中给出了各 SDXL 权重的 sha256 哈希完整文件哈希 张量数据哈希两份用sha256sum对本地文件算一遍比对即可。哈希不一致 下载坏了重新下。输出是否落地。采样脚本默认把结果写到outputs/或用--output_folder指定。检查视频文件的帧数是否符合预期SVD 14 帧、SVD-XT 25 帧、SV3D 21 帧。观感检查。抽几帧看有没有闪烁、畸变。模型本身的水平可以参考官方的人评对比SDXL 1.0 在偏好率上明显领先前代这也是选它做起点的原因。8. 避坑清单网络、显存与版本冲突按出现频率从高到低排下载慢 / 中断国内网络访问 Hugging Face 不稳定时先设置镜像再跑 cli 命令export HF_ENDPOINThttps://hf-mirror.comcli 天然支持断点续传中断后原命令重跑即可不用删半成品。显存不够OOM视频类模型是显存大户。两个旋钮--encoding_t1和--decoding_t1逐帧编解码或降分辨率--img_size512。显存再紧张就先跑 SV3D 这种单图输入别直接上 SV4D。版本冲突Python 不是 3.10依赖版本冲突高发重建虚拟环境CUDA 对不上装 torch 时的 cu118 索引要与驱动匹配驱动太旧就换对应版本refiner 不是文生图模型SDXL refiner 只能做图生图精修单独拿它当 base 用会直接跑偏9. 下一步试 4D或开始训练跑通前两个场景后可以往前一步走 SV4D 2.0把 21 帧输入视频转成多角度新视角的 4D 内容。下好sv4d2.safetensors后一条命令即可python scripts/sampling/simple_video_sample_4d2.py \ --input_path assets/sv4d_videos/camel.gif --output_folder outputs输入可以是 gif/mp4 视频、帧图片文件夹或文件名匹配模式步数默认 50嫌慢可以调小num_steps。再往后就是训练sgm是完整的训练框架configs/example_training/ 里有从 MNIST 到 ImageNet 的现成配置最小入口是python main.py --base configs/example_training/toy/mnist_cond.yaml。一句话总结一个仓库、一个checkpoints/目录SDXL 出图、SVD/SV3D 出视频、SV4D 出4D——路径已经跑通下一步就是挑一个自己的输入素材生成第一份属于自己的结果。【免费下载链接】generative-modelsGenerative Models by Stability AI项目地址: https://gitcode.com/GitHub_Trending/ge/generative-models创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考