逐节点深度解析Minimax-H3-ComfyUI双工作流:AddGuide、ReferenceToVideo与Turbo 4步首帧全拆解
【免费下载链接】Minimax-H3-ComfyUI项目地址: https://ai.gitcode.com/hf_mirrors/Alissonerdx/Minimax-H3-ComfyUI
Minimax-H3-ComfyUI 是面向 ComfyUI 的 MiniMax H3 视频模型 LoRA 工作流项目:它提供 LMS 锐化与工作流迁移两套开箱即用的工作流 JSON,核心围绕MiniMaxH3AddGuide对齐引导、MiniMaxH3ReferenceToVideo参考视频节点,以及Turbo 4 步首帧快速出稿机制展开,帮助新手用极少采样步数完成"先生成、再锐化"的两段式视频生产。
一、项目速览:两个 LoRA、两套工作流
仓库结构非常简洁,核心资产只有三处:
| 资产 | 路径 | 作用 |
|---|---|---|
| LMS 锐化 LoRA | loras/minimax_h3_lms_v1.0_r64.safetensors | Rank-64 LoRA,让源视频在保持写实时变得更锐利 |
| 风格迁移 LoRA | loras/minimax_h3_style_transfer_v1.0_r64.safetensors | Rank-64 LoRA,将源视频风格迁移到目标内容 |
| 双工作流 | workflows/ | 可直接导入 ComfyUI 的两套完整节点图 |
💡 设计哲学一句话:先用 Turbo 4 步 LoRA 快速出草稿首帧,再用 AddGuide 把源视频作为"对齐指南"送入第二遍锐化。这正是 README.md 中说的"为第二遍(锐化已有片段)而设计"。
效果对比视频可直接在仓库内预览:examples/comparison-2-audio.mp4、examples/comparison-5.mp4 等 8 组前后对比样例。
二、一键准备工作流:安装与依赖清单
导入工作流前,先确认四类依赖就位:
- 基础模型权重:Comfy-Org 发布的 MiniMax H3 权重,主训练基准是
ref2va(fl2va未充分测试)。工作流中实际加载的是 workflows/minimax_h3_lms_workflow.json#L1452-L1454 指定的minimax_h3_ref2va_pruned_int8_convrot.safetensors(int8 量化版,显存更友好)。 - ComfyUI 原生 MiniMax H3 节点:
MiniMaxH3AddGuide、MiniMaxH3ReferenceToVideo随 ComfyUI 官方支持自带,无需额外安装。 - kijai/ComfyUI-KJNodes:工作流里大量的
SetNode/GetNode(如Get_first_frames、Get_base_model)都来自该扩展,负责跨节点传递变量。 - ostris/ComfyUI-AIToolkit-MiniMaxH3:仅用于
AIToolkitMiniMaxH3RefVideo节点,作用是在送入 AddGuide 前把片段缩放到目标分辨率。不想装依赖的话,换成任意缩放节点即可(作者在 README 中明确说明可替换)。
本地获取仓库:
git clone https://gitcode.com/hf_mirrors/Alissonerdx/Minimax-H3-ComfyUI然后把 workflows/minimax_h3_lms_workflow.json 或 workflows/minimax_h3_style_transfer_workflow.json 直接拖入 ComfyUI 画布即可。
三、工作流①逐节点拆解:LMS 锐化工作流
3.1 模型加载区:UNETLoader + 双 CLIP + 双 VAE
工作流起点是标准三件套:UNETLoader加载 int8 主权重,两个CLIPLoader分别产出clip_h3(供 H3 节点使用)与clip_auto_prompt(自动提示词编码),两个VAELoader分别负责视频 VAE与音频 VAE。
注意一个关键细节:MiniMaxH3ReferenceToVideo节点同时吃vae和audio_vae两个输入(见 workflows/minimax_h3_lms_workflow.json#L4420-L4448)——说明 H3 是音视频联合生成模型,EmptyAudio节点(时长 5 秒、44100Hz、双声道)就是为此准备的静音底轨。
3.2 MiniMaxH3AddGuide 全拆解:frame_idx=0 的三个铁律
这是整个项目的灵魂节点,定义在 workflows/minimax_h3_lms_workflow.json#L3079-L3149,唯一的关键参数就是frame_idx = 0。
它和普通"参考视频"完全不同:源片段会被 VAE 编码成潜空间指南(guide latents),按三条规则与目标片段严格对齐:
| 对齐规则 | 含义 | 新手理解 |
|---|---|---|
| 相同时间起点 | frame_idx=0,指南第 i 帧与目标第 i 帧同位置 | 指南时钟和目标时钟从同一秒开始走 |
| 相同空间网格 | 指南在目标分辨率下编码 | 指南 token (t,y,x) 精确落在目标 token (t,y,x) 上 |
| 不推进参考时钟 | 指南"叠加"在目标时间线上,而非追加在前 | 注意力对齐零成本,模型不用"找对应关系" |
由此衍生出两条实操红线:
- 🔴指南时长不能短于目标,且分辨率必须一致——否则对齐崩掉;
- 🔴片段长度必须落在合法序列
17k+5上:5、22、39、56、73、90、107、124……工作流里甚至专门写了个数学表达式节点自动取整(workflows/minimax_h3_lms_workflow.json#L3256-L3258)。
训练时指南几乎不加噪(约 0.1%),而目标正常加噪,所以模型学到的是"逐像素映射",而不是两边一起降噪。文本编码器完全看不到指南——只有提示词文本进编码器,视频纯以潜变量进 Transformer。
3.3 Turbo 4 步首帧:第一遍如何快速出稿
工作流采用两段式采样。第一遍(first pass)挂载 Turbo 加速 LoRA:
- 加载位置:workflows/minimax_h3_lms_workflow.json#L2620-L2623
- 文件名:
minimax_h3_ref2v_turbo_4step_v0.1_comfyui_bf16.safetensors,经LoraLoaderModelOnly以强度 1.0 注入
它的任务是用4 个采样步基于首帧/参考快速生成一段草稿视频,产物通过first_frames、first_pass_result_frames、first_latent等 KJNodes 变量传递到第二遍。第二遍再把这段草稿接入 AddGuide,由 LMS LoRA 完成锐化——这就是标题里"Turbo 4 步首帧"的完整链路:快糙出稿 → 对齐锐化。
3.4 MiniMaxH3ReferenceToVideo 节点:为什么它处于旁路状态
该节点位于 workflows/minimax_h3_lms_workflow.json#L4401-L4529,支持最多 2 路参考图像 + 参考视频 + 参考音频,默认分辨率 672×384、长度 107 帧。
但它与 AddGuide 是两套竞争机制:ReferenceToVideo 传入的是"自带独立时钟"的参考块(追加在目标时间线之前),而 AddGuide 传入的是"对齐时钟"的指南块。LMS 工作流中该节点被设为旁路(bypass)模式——作者明确建议:与 AddGuide 叠加使用属于实验性玩法,"结果会不同,但不一定更好"。新手请保持旁路,先把指南链路跑通。
3.5 采样链与低显存三件套
BasicScheduler(simple 调度)+SamplerCustomAdvanced+euler采样器 +CFGGuider,噪声由RandomNoise节点以固定种子 42 生成,保证结果可复现;- 低显存三件套:
MiniMaxLowVRAMAttention、MiniMaxChunkFeedForward、MiniMaxH3SigmaShift(workflows/minimax_h3_lms_workflow.json#L1285、#L1331、#L2010),分别做注意力分块、前馈分块与 sigma 偏移,是消费级显卡跑通 H3 的关键; - 工作流还内置了一张 16:9 分辨率速查表节点(0.2~2.0 兆像素,如 960×544、1920×1088),选尺寸时直接对照即可。
四、工作流②逐节点拆解:风格迁移工作流
workflows/minimax_h3_style_transfer_workflow.json 与 LMS 工作流共享同一套骨架(UNet/CLIP/VAE 加载、低显存三件套、Set/Get 变量总线),差异集中在三点:
- AddGuide 同样锚定 frame_idx=0,且节点内显式保留了命名参数(workflows/minimax_h3_style_transfer_workflow.json#L2491-L2496),图像输入取自
Get_first_frames变量——首帧同样走"对齐指南"通道; - Turbo 4 步 LoRA 复用:同样经
LoraLoaderModelOnly加载(workflows/minimax_h3_style_transfer_workflow.json#L3729-L3736),第一遍出稿逻辑与 LMS 一致; - ReferenceToVideo 节点同样在列(#L4927),风格迁移场景下可以实验性启用参考视频输入,但注意它与指南机制并存时属于双重条件注入,效果需自行验证。
🎨 使用建议:风格迁移 LoRA 配合 AddGuide 时,提示词写法参照 README 的触发式描述(一句说明"做什么"即可),避免长篇描述干扰像素级对齐。
五、避坑清单:新手最常踩的 4 个坑
| 现象 | 原因 | 解决 |
|---|---|---|
| 生成后画面与源视频"对不上位" | 指南分辨率或时长与目标不一致 | 保证同源缩放,长度取17k+5序列 |
| 节点标红找不到 | 缺少 KJNodes / AIToolkit 扩展 | 装 kijai/ComfyUI-KJNodes;AIToolkit 节点可换普通缩放节点 |
| 首帧闪变、草稿崩坏 | 第一遍 4 步 LoRA 权重未加载或强度不为 1 | 检查LoraLoaderModelOnly指向 Turbo 文件且 strength=1 |
| 显存爆掉 | 未走低显存路径 | 确认 MiniMaxLowVRAMAttention / ChunkFeedForward 在链路中,并选 0.5 兆像素档位 |
六、附录:文件与节点路径速查
- 说明文档:README.md
- LMS 工作流:workflows/minimax_h3_lms_workflow.json(AddGuide 见 #L3079,ReferenceToVideo 见 #L4401)
- 风格迁移工作流:workflows/minimax_h3_style_transfer_workflow.json(AddGuide 见 #L2423)
- LoRA 模型:loras/
- 前后对比样例:examples/
掌握AddGuide 的三铁律 + Turbo 4 步两段式,这套双工作流就能稳定复现"低步数出稿、高保真锐化"的完整链路。
【免费下载链接】Minimax-H3-ComfyUI项目地址: https://ai.gitcode.com/hf_mirrors/Alissonerdx/Minimax-H3-ComfyUI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考