2026/9/7 12:20:08

ComfyUI搭建MiniMax H3双模工作流:从文生视频到图生视频完整教程

ComfyUI搭建MiniMax H3双模工作流:从文生视频到图生视频完整教程 上一期发完 ComfyUI 的基础工作流之后评论区里就一直有人在问 MiniMax H3 什么时候安排。从私信和留言的数量来看大家对这个模型的兴趣确实很高尤其想知道它到底能不能在 ComfyUI 里跑起来、要怎么搭工作流、有哪些坑。考虑到问的人太多这一期干脆把 MiniMax H3 的双模工作流完整拆给大家。本文会从模型选型、ComfyUI 环境准备、双模工作流设计思路、完整搭建流程、常见报错排查和工程化建议几个方向展开。无论你是第一次接触 ComfyUI还是已经跑过几个基础工作流都可以按这套思路把 MiniMax H3 用起来。1. MiniMax H3 到底是什么为什么大家都在玩1.1 从文本模型到多模态内容生成MiniMax H3 是 MiniMax 开源的大规模多模态模型。很多新手第一次听说它是因为视频生成和图像生成的效果还不错而且模型权重是可以下载到本地部署的不需要每次生成都依赖云端 API。和普通文本模型不同MiniMax H3 在 ComfyUI 生态里出现时通常以 Checkpoint 的形式加载配合 ComfyUI 的采样、解码节点可以完成从文本到图像、从图像到视频、从参考图到视频等多步生成任务。不过大家要注意一个概念问题MiniMax H3 并不是单独的“视频软件”它更像一个生成引擎。你在 ComfyUI 里看到的“导演台”“全能参考模式”等说法本质上是围绕这个模型设计的不同工作流分支。所谓的“双模”通常指的是文生视频和图生视频参考图驱动这两种生成模式。搞清楚这个区别后面搭工作流时才不会混乱。1.2 双模工作流解决什么问题如果你只用文本生成视频往往控制力不够。比如你想让画面里的角色动作更稳定、场景更统一纯靠提示词描述会很费劲。MiniMax H3 双模工作流的优势在于一个工作流里同时保留文生视频和参考图/图像生成两条路径你可以根据需求来回切换。文生视频适合快速验证创意输入提示词后直接生成一段视频。图生视频/参考图模式适合需要把握角色、构图、风格的场景先用图像锁定基础内容再生成运动视频。从社区反馈来看大家最常提的“视频生成视频动作不一致”大多也跟模式选择和参数调节有关。后面我会专门讲这部分。1.3 为什么要在 ComfyUI 里搞ComfyUI 的节点式设计特别适合 MiniMax H3 这种流程较复杂的模型。相比 WebUI 的一键生成ComfyUI 会把加载模型、采样、VAE 解码、视频保存拆成一个个节点你可以直观看到数据在每一步是怎么流动的。对于新手一开始可能觉得节点图眼花但一旦跑通一次你就会发现排查问题非常方便。这也是我坚持把教程写成 ComfyUI 系列的主要原因。2. ComfyUI 环境准备2.1 整合包与手动安装怎么选ComfyUI 目前主流的安装方式主要有两类。第一类是使用社区整合包比如秋叶整合包第二类是手动从 GitHub 拉源码自己配 Python 环境。如果你是纯新手建议先用整合包把整体流程跑通。整合包一般会把 Python 环境、ComfyUI 主程序、常用插件提前打包好你只需要下载解压然后按说明启动即可。不过要注意整合包也不是万能的它可能内置了较多插件启动速度会受影响而且部分插件版本可能与 MiniMax H3 所需的节点版本不匹配。如果你在 Linux 服务器上部署或者对环境比较熟悉更推荐手动安装。核心步骤如下git clone https://github.com/comfyanonymous/ComfyUI.git cd ComfyUI python -m venv venv source venv/bin/activate pip install -r requirements.txt无论哪种方式都需要保证显卡驱动和 PyTorch 版本匹配。新版 ComfyUI 一般会要求较新的 CUDA 环境如果启动时提示 CUDA 不可用大概率是 PyTorch 装成了 CPU 版本。2.2 目录结构ComfyUI 的模型文件都放在models目录下。MiniMax H3 相关的模型文件通常放在models/checkpoints里。建议先熟悉下面这个目录结构ComfyUI/ ├── ComfyUI/ │ ├── custom_nodes/ # 自定义节点各种插件放这里 │ ├── models/ │ │ ├── checkpoints/ # 大模型文件 │ │ ├── loras/ # LoRA 模型 │ │ ├── vae/ # VAE 文件 │ │ └── ... │ ├── output/ │ └── ... ├── python/ ├── main.py └── ...如果你用的是整合包目录结构基本保持一致只是入口脚本可能换成了启动 ComfyUI.bat之类的双击启动文件。2.3 启动方式手动安装的目录下在激活虚拟环境后执行下面命令启动python main.py --listen 127.0.0.1 --port 8188--listen表示监听地址127.0.0.1代表只允许本机访问--port是端口号默认 8188。启动成功后浏览器打开http://127.0.0.1:8188就能看到 ComfyUI 的工作台。整合包用户一般不需要敲命令双击启动脚本即可。启动脚本里通常还会带--auto-launch参数自动帮你打开浏览器。这里提前说一句不同整合包内置的 Python 版本、ComfyUI 主程序版本可能差很多如果后续出现节点报错不要只怀疑自己的操作也要检查版本是否匹配。3. MiniMax H3 模型与依赖准备3.1 模型下载与放置路径MiniMax H3 模型文件比较大下载前先确认自己的硬盘空间和显存是否够用。对于新手我建议优先下载社区常用的预转换 Checkpoint 文件这类文件通常可以直接放入models/checkpoints目录使用。如果你下载的是原始权重可能需要额外脚本转换流程相对复杂不适合第一轮跑通。文件放置路径参考ComfyUI/models/checkpoints/ └── MiniMaxH3_xxx.safetensors加载节点选择Load Checkpoint时下拉列表里就能看到这个模型文件。需要特别提醒包括整合包在内的各种社区资源来源渠道良莠不齐下载时注意核对文件大小、哈希值和官方说明。若非官方渠道发布的模型首次运行前建议先在隔离环境验证避免文件损坏或夹带异常内容。3.2 额外节点与插件安装MiniMax H3 在 ComfyUI 里能跑起来通常离不开特定的自定义节点支持。打开 ComfyUI 后通过ComfyUI Manager搜索MiniMax或H3能搜到对应节点。建议通过 Manager 安装它会自动处理依赖关系。如果 Manager 里搜不到也可以从 GitHub 上手动git clone到custom_nodes目录然后重启 ComfyUI。cd ComfyUI/custom_nodes git clone https://github.com/你的目标节点仓库地址.git重启 ComfyUI 后如果节点加载成功控制台会有对应日志输出。如果没有任何输出可能是插件版本与当前 ComfyUI 不兼容可以去看插件仓库的 README确认它支持的 ComfyUI 版本范围。3.3 核心参数基础CFG、步数与 Block Cache这里有必要先解释几个高频概念因为它们会直接影响生成效果。CFGClassifier-Free Guidance控制生成结果遵循提示词的程度。CFG 越高内容越贴近提示词但过高会让画面发“死”、动作僵硬过低则会出现提示词描述不生效的问题。在 ComfyUI 的KSampler节点里cfg就是这个参数。MiniMax H3 相关节点里的 CFG 含义基本一致但不同实现细节可能略有差异建议从默认值开始调。步数Steps扩散模型迭代的次数。步数越高细节通常越完善但耗时成倍增加。视频生成场景下建议先以一个较低步数跑通流程再逐步提高。Block Cache部分 MiniMax H3 工作流里会出现block cache相关选项这是为了跳过重复计算、降低显存占用而设计的缓存机制。开启后能减少相同 block 的重复推理但过度开启可能影响生成结果。不同分支对此支持程度不同建议保持默认。这三个概念并不是孤立的。比如当你发现“视频生成视频动作不一致”时优先排查的就是 CFG 设置、提示词描述和参考图的匹配程度而不只是盲目换模型。4. 双模工作流核心拆解4.1 什么是双模工作流从整体上看MiniMax H3 双模工作流可以简化为两条分支分支 A文本 → 视频文生视频分支 B图像 → 视频 / 导演台参考图驱动视频为了共用一套加载模型、采样、输出节点我们会在同一个工作流里把两条路径拼接起来。ComfyUI 的节点式设计非常适合这种结构因为你可以把文本编码和图像编码分别做成两个入口最后汇聚到同一个采样节点。4.2 Director 导演台与全能参考模式热词里反复出现“导演台”“director”和“ref2va 全能参考模式”这里我用自己的理解梳理一下。Director导演台主要面向需要精细控制生成过程的场景。你可以把“导演台”理解为一个高级控制面板里面可以设置镜头语言、动作描述、画面切换等结构化的生成指令而不是只依赖一段长提示词。ref2va全能参考模式从名字看是 reference-to-video 的缩写意思是把参考图作为输入引导视频内容生成。这个模式很适合做“首帧控制”或“角色一致性”任务。你需要准备一张参考图并写清楚希望画面发生什么动作。这两个方向并不冲突。你在一个工作流里可以先走“参考图模式”锁定视觉风格再通过“导演台”设置动态变化最终得到一张图驱动的可控视频。对于大多数不追求极端精细控制的用户来说先用好“参考图模式”就已经能解决很多问题了。4.3 图生视频与文生视频的衔接一个容易卡住新手的点是ComfyUI 里同一个采样节点只能接收一种条件输入怎么做到一个工作流既能文生视频又能图生视频常见的做法是使用条件切换节点或者直接搭建两条独立采样路径。如果条件切换节点在你的插件版本里找不到那就老老实实复制一份采样链路然后用分组框把两条链路分开。这样做的好处是逻辑清晰坏处是节点数量变多显得复杂。但对于新手来说看得懂比节点少更重要。5. 完整实操搭建一个可用的 MiniMax H3 双模工作流下面我们进入实战环节。为了让流程尽量通用这里不会依赖某一个特定整合包的私有节点而是把核心思路和节点配置模板写清楚。你可以根据自己的插件版本做微调。5.1 创建项目结构在 ComfyUI 里新建工作流后先用Group Node分组节点把画布分为三个区域模型区、输入区、生成区。模型区负责加载 Checkpoint、VAE 等基础模型。输入区放置文本提示词节点和图像加载节点。生成区负责采样、解码、保存视频。这样的分组并不影响实际运行但能让你在后续调试时快速定位问题。5.2 加载模型与基础配置拖入一个Load Checkpoint节点在下拉列表中选择 MiniMax H3 对应的模型文件。此时通常会自动带出MODEL、CLIP、VAE三个输出端口分别代表采样模型、文本编码器和 VAE 解码器。再拖入一个空的VAE Loader节点选择与模型匹配的 VAE 文件。如果模型内置了 VAE也可以直接使用Load Checkpoint输出的 VAE不一定需要单独加载。模型区的连接逻辑大致如下Load Checkpoint ├── MODEL → [采样节点] ├── CLIP → [文本编码节点] └── VAE → [VAE 解码节点]5.3 分支 A文生视频链路文本输入部分需要一个CLIP Text Encode节点。第一个输入框写正向提示词第二个输入框通常写负向提示词。在 ComfyUI 的KSampler节点里负向提示词会参与条件生成用来告诉模型“不要出现什么”。接下来把节点连接成下面这种形式Load Checkpoint ── MODEL ────────────────────────→ KSampler Load Checkpoint ── CLIP ──→ CLIP Text Encode ────→ KSampler positive Load Checkpoint ── CLIP ──→ CLIP Text Encode ────→ KSampler negative Empty Latent Image ── Latent ────────────────────→ KSampler KSampler ── LATENT ──→ VAEDecode ──→ 视频保存节点这里Empty Latent Image的作用是生成空白潜空间图像你可以决定视频的初始尺寸和帧数。在 MiniMax H3 视频类节点中如果插件提供了专门的视频尺寸控制节点优先用专门节点因为输出张量的形态可能不同。5.4 分支 B图像参考链路如果你想让角色或场景更可控就走参考图像链路。操作上先拖入Load Image节点导入你的参考图然后经过一个图像编码或预处理节点把它转成采样器需要的条件输入。常见的连接方式Load Image ↓ 图像预处理节点尺寸调整 / 编码 ↓ 参考视频条件节点 ↓ 采样节点在提示词层面必须把“画面中角色保持原样只有哪些部分发生变化”说清楚。推荐的提示词写法是先描述整体画面再描述动态变化例如“角色保持与参考图一致镜头缓慢推近背景保持不变”。这种写法比只写“生成视频”要稳定得多。如果你使用的节点包提供了ref2va相关选项可以把它理解为“更完整的参考控制”。实际使用时注意参考图上不要有过多的文字或无关元素否则模型会把这些内容也“参考”进去。5.5 运行与验证连接好工作流后点击Queue Prompt执行。首次运行会自动加载模型到显存耗时较长第二次开始通常会快一些。如果运行成功输出节点会返回一段视频文件可以在 ComfyUI 的output目录中找到结果。验证视频是否符合预期主要看三点视频里的人物、场景是否与提示词一致。画面动作是否自然有没有出现明显的变形或跳变。如果是图生视频参考图中的关键元素是否保留住了。不符合预期时不要急着换模型先按下面顺序检查提示词是否包含了足够的细节CFG 是否过大或过小步数是否太低参考图是否清晰、构图是否干净6. 常见问题与排查这一节直接进入大家最容易踩坑的部分。下面列出几个高频问题并给出排查思路。问题现象常见原因解决思路节点执行过程中报错failed to execute节点输入端口连接错误、使用了错误的输出类型、模型路径不对检查报错节点是哪一个重点看它的输入端是否连接完整确认模型文件已放入对应目录提示词不起作用画面偏离文本CFG 设置过低或步数太少从cfg7、steps30开始调逐步提高 CFG视频生成视频动作不一致参考图信息没有被充分利用提示词对运动描述不足改用参考图模式把提示词细化描述“谁在动、怎么动、背景是否变化”显存不足生成过程中断视频分辨率、帧数、批次设置过大降低分辨率减少帧数开启 Block Cache 或 xformers 加速MiniMax H3 在 AMD CPU 上能否本地部署官方通常优先支持 NVIDIA CUDA 环境CPU 解码速度极慢如果只有 CPU建议先用云端或远程 GPU 跑通流程若必须本地需准备好长时间等待LoRA 加载后无效果或报错LoRA 版本与模型基础版本不匹配确认 LoRA 是针对 MiniMax H3 训练的并检查权重目录位置是否正确下面展开几个重点问题。6.1 failed to execute 报错ComfyUI 的报错信息会明确告诉你哪个节点执行失败。新手遇到这种报错时先不要着急重装软件而是按下面顺序排查首先确认所有必要输入端口都已经连上。ComfyUI 的节点端口没有连上时端口会变色鼠标放上去还能看到“REQUIRED”提示。最常见的错误就是把MODEL端口漏接了。其次看控制台日志。如果日志里提示找不到模型文件说明 Checkpoint 路径不对。检查文件是否在models/checkpoints下文件名是否包含空格或中文如果有可以改成简单的英文名。最后检查插件版本。有些节点包更新后节点名称或输出端口会变化旧工作流直接加载就会报错。这种情况可以新建一个同样的节点手动比对端口类型。6.2 视频动作不一致的排查思路这是 MiniMax H3 用户讨论度最高的问题。我的建议是分两层排查第一层是提示词。对于图生视频场景不要只写“女人在走路”而要写清楚“女人穿着参考图中的红色外套在街道上从右向左行走镜头固定背景轻微虚化”。视频模型对动作的描述是很敏感的提示词写得越具体动作一致性越高。第二层是采样参数。CFG 过高时模型会过度“追求”静态画面的细节导致动作变化很少或很僵硬CFG 过低时动作可能变得夸张甚至跑偏。遇到动作不一致可以把 CFG 下调 1 到 2 个点试试。另外如果参考图里人物占比较小模型容易忽略掉细节建议参考图裁剪后再输入。6.3 显存优化视频生成本来就比单纯文生图吃显存。如果你显存只有 8GB 左右建议优先用小分辨率测试例如512x512或480x832帧数控制在 30 帧以内。显存不够时有几个通用优化方向开启 xformers 或 PyTorch 的 SDPA 优化。将Empty Latent Image的batch_size设为 1。查看节点是否提供block cache或offload选项按需开启。运行视频生成时尽量关闭其他占用显存的程序。6.4 AMD CPU/部分 AMD 显卡用户部署问题“能不能在 AMD CPU 上本地部署”这个问题经常被问。严格来说模型部署和推理是两个层面。如果 MiniMax H3 的推理代码主要依赖 CUDA 加速那么纯 CPU 环境虽然理论上可以跑但速度会慢到很难接受视频生成本来计算量就很大建议不要对本地 CPU 推理抱太高期望。如果你手头是 AMD 显卡需要看具体节点包是否支持 ROCm 或 DirectML 后端。不同分支支持度差异较大而且配置复杂度高。对新手来说最稳妥的路径是先跑通 NVIDIA CUDA 环境再考虑在异构设备上部署。7. 最佳实践与工程建议7.1 工作流版本管理ComfyUI 工作流的本质是 JSON 文件里面记录了每个节点的位置、类型和参数。我强烈建议你每次调整出一个可行的版本后立刻用 “Export” 导出一份 JSON 存档文件名可以用日期用途区分例如minimax_h3_t2v_20260115.json。这样即使后续改坏了也能迅速回退。7.2 模型文件管理ComfyUI 的模型目录是可以自由扩展的。当你的模型越来越多时不要把所有文件都堆在checkpoints里。建议在models下建立子目录例如models/minimax_h3/存放 MiniMax H3 相关文件。不过要注意不是所有节点都支持子目录路径如果下拉列表里显示不出来再考虑回归默认目录。7.3 批量测试固定参数找一组效果尚可的参数之后尽量不要频繁改动所有参数。推荐“一次只改一个变量”的策略比如先固定步数和 CFG分别测试不同参考图的效果再固定参考图测试 CFG 的变化。这样你能很快总结出“什么参数适合什么场景”的经验而不是靠猜。7.4 关注显存和内存监控本地生成视频时显存使用量是核心指标。命令行下可以直接用nvidia-smi实时查看显存占用。Python 脚本方式import torch if torch.cuda.is_available(): print(GPU:, torch.cuda.get_device_name(0)) free_mem, total_mem torch.cuda.mem_get_info() print(f显存剩余: {free_mem / 1024 ** 3:.2f} GB) print(f显存总量: {total_mem / 1024 ** 3:.2f} GB) else: print(CUDA 不可用当前处于 CPU 模式)把监控脚本和 ComfyUI 启动脚本放在一起遇到崩溃时可以快速判断是不是显存瓶颈。7.5 安全边界与生产环境建议如果你只是自己玩本地部署问题不大。但如果你想在公司服务器或生产环境中搭建 MiniMax H3 服务有几个边界必须注意模型许可协议要提前确认确认是否可以商用、是否需要保留版权声明。服务器上的 ComfyUI 默认监听端口不要直接暴露到公网建议用--listen 127.0.0.1加反向代理或至少设置防火墙。不要随意运行来源不明的第三方节点尤其是要求你关闭防火墙、上传密钥、跳转外部链接的节点。批量生成大量视频前做好磁盘空间预估。视频文件体积不小建议单独挂载一个数据盘并定期清理output目录。7.6 从“跑通”到“调好”的进阶顺序很多新手跑通一次后就急着追求复杂效果。我的建议是先按下面顺序进阶先跑通默认参数确认模型和节点没问题。用同一张参考图尝试不同提示词理解提示词对视频内容的影响。固定提示词调整 CFG、步数观察画面变化。再引入导演台、ref2va 这类高级控制。最后再去尝试 LoRA 训练或模型融合。每一步都最好留档后续遇到问题才能快速定位。7.7 保存结果时注意命名规范ComfyUI 默认输出的文件名并不好辨认。建议在保存视频的节点里设置输出文件名模板至少包含模型名、日期和生成模式。例如MiniMaxH3_ref2va_20260115.mp4。好的命名习惯可以帮你快速区分大量实验结果避免后期反复打开文件对比。MiniMax H3 双模工作流的搭建并不算复杂真正费时间的往往是提示词调试和参数调优。先把“文生视频 图生视频”两条链路跑通再一步步加入参考图、导演台等高级功能你对整个生成过程的控制力就会明显提升。如果你在搭建过程中卡在某一步也可以把报错信息拉到评论区大家一起排查。先把第一个视频生成出来比什么都重要。