minimaxH3-套件节点。

20260907 更新至V2.5版本::

minimaxH3-套件节点。20260912 V2.5版本

COMFYUI HELPER 套件 MINIMAX-H3 全家桶 即插即用 · 不改源码
closerAI-minimaxH3-Helper 套件
提示词结构化 · 音画规划 · 低显存运行 · ClipProj 编码 · 实验性加速

所有功能均在 custom_nodes 插件目录内实现,不修改 ComfyUI 内部源码,因此不会阻碍 ComfyUI 后续升级。旧目录名和旧节点 ID 继续保留,已有工作流无需重建。

FastH3 原生 VSA 会员分发与 RTX 30/40/50 wheel 构建请阅读 FastH3会员发布与多架构Wheel构建手册
27+功能节点
17n+5H3 帧数规则
4-15s单次时长
3600s长视频上限
8~32GB显存适配
00 — POSITIONING
项目定位

即插即用的 ComfyUI Helper 套件,围绕 MiniMax-H3 提供提示词结构化、参考图分析、音画规划、低显存运行、ClipProj 条件编码与实验性加速能力。

安装目录
ComfyUI/custom_nodes/closerAI-minimaxH3-PromptHelper
01 — CASE LIBRARY
closerAI H3 案例库

推荐使用方式已简化:在长视频导演手动长视频时间线导演的生成参数中选择案例效果参考,然后照常填写自己的需求生成整体计划。案例只提供分段节奏、视觉组织、运镜、声音结构和限制条件,不复制案例人物、品牌、场景、对白或剧情。独立案例库节点继续保留,用于兼容已有工作流,但不再是常规推荐入口。

四区工作台

  • 左侧窄栏按分类筛选和搜索,配方区使用紧凑单行列表。
  • 中间保留需求、时长、模式、画幅、语言、应用范围和素材职责等常用参数。
  • 右侧为大面积计划结果编辑器,按分段标签切换,可直接修改、复制和保存回冻结计划。
  • 顶部 LLM 配置 打开侧边抽屉;显存策略等收进 更多生成设置
  • 展开/收起连接点切换完整输入输出标签;折叠时端口仍可接线,状态随工作流保存。

首批内置 12 个配方

案例数据保留官方来源地址和套件版本,但不内置官方图片、视频、品牌、角色或成片提示词
操作步骤
把图片、视频帧、视频音轨或独立音频接入案例库节点。被忽略的上游节点会视为未连接。
左栏选择案例,点击 使用案例——节点应用推荐时长、画幅、FI2VA/Ref2VA 模式,并尝试把当前已连接素材分配给不同语义职责。
右栏填写自己的视频需求与创意变量,逐项确认 人物参考产品参考动作参考目标音色 等职责。一个素材不能同时冒充两个职责。
选择 完整案例结构 或只应用某一结构,点击 生成长视频计划——直接使用节点内已配置的 OpenAI 兼容 / Gemini 接口,不会把工作流加入执行队列
状态显示"计划已生成并冻结"后再执行工作流。执行阶段只读取 案例计划草稿,不会在长视频循环中重新调用 LLM。
案例预检会阻止必需职责未绑定、绑定输入断开或被忽略、声音案例没有画面、素材数量超过 H3 限制等情况。官方边界:单次 4 至 15 秒、24fps、图像最多 9 张、视频最多 3 段、混合素材最多 12 个、单段提示词最多 7000 字符。案例节点本身只做 CPU 文本编译,不增加采样显存。更新节点后必须完全重启 ComfyUI
接入示例 · EXAMPLES
example_workflows/
closerAI H3案例库-FI2VA接入示例.json
closerAI H3案例库-Ref2VA多图接入示例.json
02 — NODES OVERVIEW
节点总览

套件共 27+ 节点,按功能分为提示词与素材、模型加载与加速、音频工具链、长视频链四大类。"是否加载/运行大模型"一列明确每个节点的资源占用。

A · 提示词与素材编排
节点作用加载大模型?
PromptHelper将中文需求和参考图转换为符合 MiniMax-H3 结构的中英文提示词。仅调 API
ReferenceImageBatch按连接顺序合并 1-9 张 IMAGE
LocalResultParser将本地 LLM 返回的 <EN>...<ZH>... 拆分为两路文本。
Studio规划 H3 画幅、时长、分镜、帧数和参考图方案。
AudioDirectorAUDIO 生成音画节奏段落与 H3 音频提示词骨架。
MaterialCopilot可视化编排图像、视频帧和音频素材,以 @素材 生成 H3 提示词。仅调 API
H3CameraDesigner可视化相机/光影设计器:关键帧、双灯布光、中文预设,合并相机/光影/画面/音频提示词。否(需 NyckM 3D Camera)
B · 模型加载 / 加速 / 采样
节点作用加载大模型?
TurboLoRA-Pruned在 pruned H3 上加载 Turbo、效果、风格、角色等通用 LoRA(显示名"通用 LoRA-Pruned(兼容 Turbo)")。
FastH3Loader加载 Kijai FastH3 INT8 ConvRot 权重并补齐 VSA gate 结构。是(默认 Dense)
FastH3DenseLoRA-Pruned将 Dense FastH3 四步适配器加载到 FL2VA pruned 基模,低显存流式加载。
FastH3Sigmas生成 FastH3 训练使用的精确四步时间表。
FastH3SamplerFastH3 对应 Euler 采样器。
FastH3VSA原生 VSA:64 行块、4x4x4 视频立方块、条件/音频保护、learned coarse gate 与分块 QKV;依赖 comfy-kitchen PR 117。是(避免 BF16 Q/K/V 峰值)
Speed非侵入式 DiT 残差缓存加速,存在近似误差。仅当前工作流副本
Spectrum实验性采样预测加速,存在质量取舍。仅当前工作流副本
TurboSamplerH3 Turbo 的视频/音频双调度采样器。
SpaceTimeTiledSampler潜空间放大后低 Sigma 第二采的 H3 安全时间分块;空间保持全画幅。是(按时间窗口)
SLAAttention布局感知 SLA v2:文本/参考/音频/边界查询密集,仅稀疏纯视频区域;支持前中后步骤视频 KV 预算。否(仅替换 Attention 路径)
ClipProjLoader用 Qwen3-VL 4B/8B 投影替代 H3 32B 编码器,GPU 编码后立即释放。是(仅编码阶段)
ClipProjFree创建显式执行屏障,释放 ClipProj 或全部 ComfyUI 模型显存。
C · 音频工具链
节点作用加载大模型?
AudioRepair对 H3 已生成音频执行响度、动态、峰值与首尾修复,输出测量报告。
AudioStrategy分析对白、环境声和非英语语音风险,建议 4B/8B/32B 编码器。
AudioBenchmark对比 32B 原生与 4B ClipProj 的客观电平、频谱及波形指标。
AudioTrainingPairExporter导出同提示词的 4B hidden 与 32B teacher Conditioning 训练对。4B 编码阶段
AudioResidualProjection将训练完成的低秩音频残差附加到优化 ClipProj。约数 MB
D · 长视频链(14 节点)
节点作用
LongVideoDirector按用户选择的单一语言生成完整故事、分段提示词、素材变化和 H3 帧计划。
SegmentSelector手动读取指定段落的提示词与帧数。
SegmentMaterialRouter递归执行时只输出当前段真正使用的素材。
ChainPlanAdapter把导演计划编译成可断点恢复的递归计划。
ChainLoopStart / Current / Context / Trim / SegmentCheckpoint / LoopEnd / Assemble逐段采样、上下文续接、音画裁剪、检查点和最终拼接。
ProgressPreview只读查看已成功分段,可单段预览或顺序预览。
ContinuationPolicy按显存档位选择连续上下文、视频交叉淡化和音频去点击参数(8GB~24GB)。
AutoHandover在 CPU 上分析分段尾部冻结状态,给出 Safe Tail Bridge 建议。
SeamlessAVJoin对已解码的两段视频和音频执行帧级交叉淡化及毫秒级去点击拼接。
LongRunBatch按显存自动分批:8GB=6段、12GB≈8段、16GB≈12段、24GB≈18段。
PostRunBranch完整生成后的分支重生成(默认透传,不改变正常生成)。
SeamlessChainAssemble自动无缝拼接:接收 manifest,CPU/FFmpeg 处理冻结尾帧、交叉淡化与去点击。
03 — AUDIO TOOLCHAIN
H3 音频修复 / 基准 / 残差投影

音频修复 · 默认值(适合普通网络视频)

-16 dBFS
-1 dBFS
0.30
-55 dBFS
15ms
对白增强用较明确压缩;环境声增强减弱压缩且噪声门 ≤ -70 dBFS(保留雨声/风声/底噪);仅响度标准化不执行噪声门和压缩。
报告中响度是 RMS dBFS,不是严格 BS.1770 LUFS。节点只能修复已存在的波形,不能恢复模型没生成的音效,也不能修复错误语言。非英语对白先过 音频策略分析

32B 与 4B 音频基准

  • 相同提示词、首帧、seed、分辨率、帧数、模型、LoRA、采样设置分别生成两次。
  • 32B 工作流 VAEDecodeAudio参考音频_32B;4B ClipProj 工作流 → 测试音频_4B
  • 报告时长、采样率、声道、RMS、峰值、峰均比、削波、静音占比、频谱重心/带宽、85% 滚降、波形相关性、对数频谱距离,输出可归档 JSON。
  • 波形相关性只适用于时间对齐且内容相同的音频;不同 seed 时不能直接当质量分数。
  • 不加载 ASR/CLAP,对白语言和环境声完整性显示"未评估"。
音频残差投影 · 推理接线
ClipProj优化加载器.CLIP 音频残差投影.CLIP
音频残差投影.CLIP MiniMaxH3ImageToVideo.clip 或 ReferenceToVideo.clip
权重放入 ComfyUI/models/clip_projections/,选择 closerai_h3_audio_residual_v1残差强度=1.0 为训练标定值;同 seed 从 0.5 / 0.75 / 1.0 做 A/B。普通投影、LoRA 或未知 safetensors 不会出现在残差下拉框;节点验证 2560→5120 等实际维度,不匹配时停止执行。

采集训练对

  • 工作流须同时存在原生 32B 教师分支closerAI 4B 学生加载器
  • 32B 的正向 CONDITIONING教师Conditioning_32B;4B 优化加载器 → 学生CLIP_4B相同提示词 填入完全相同文本。
  • 样本保存到 ComfyUI/output/closerAI_audio_residual_dataset/;默认只保存提示词 SHA-256,打开 保存提示词明文 才写原文。
  • 样本级权重:普通视觉 0.25、环境声/音乐/拟音 1.0、对白 1.5、非英语对白 2.0
训练脚本(PowerShell)
python scripts/train_audio_residual.py `
  --data-dir "ComfyUI/output/closerAI_audio_residual_dataset" `
  --base-projection "ComfyUI/models/clip_projections/h3_qwen3vl_4b_CONDPROJ_tap24.safetensors" `
  --output "ComfyUI/models/clip_projections/closerai_h3_audio_residual_v1.safetensors" `
  --rank 256 --epochs 10 --device cuda
至少 2 个样本可执行,但有效训练应覆盖对白、非英语对白、环境声、音乐、拟音和无声音要求并准备足够独立提示词;微型测试通过 ≠ 具备泛化能力。没有真实教师数据和对照测试前,套件不会伪造或默认启用残差权重。
04 — CLIPPROJ
ClipProj 优化加载器

ClipProj 运行时已内置在套件的 third_party_clipproj 目录,无需单独安装 nicolab28/ComfyUI-ClipProj;保留上游 MIT 许可证,升级套件即统一更新。0.1.13 核心支持纯 MLP v3 矩阵、INT8 视觉塔分页回退、真正区分 streaming 整块加载与 dynamic 逐层分页。

推荐连线
closerAI ClipProj优化加载器.CLIP MiniMaxH3ImageToVideo.clip
MiniMaxH3ImageToVideo positive / latent → guider / sampler 编码器不参与扩散采样
参数说明 · 8GB 建议
参数作用8GB 建议
编码器模型Qwen3-VL 小模型。qwen3vl_4b_int4_convrot.safetensors
编码器架构从权重头识别 4B/8B/32B。auto
投影矩阵将小模型隐藏状态投影到 H3 5120 维空间。与 4B 对应的 H3 tap24 safetensors
显存策略编码器放置和释放时机。8GB GPU编码后释放(推荐)
GPU设备编码阶段使用的 GPU。单卡选 cuda:0
投影计算精度2560→5120 矩阵乘法精度;归一化与最终缩放始终 FP32。首次 FP32兼容;确认后试 BF16
投影分块Token分批投影 token 数。256;多参考图 OOM 降到 128
Conditioning精度编码后保存的条件张量精度。默认原始精度;内存紧试 BF16
缓存条目内存保留的 Conditioning 数量。2;内存紧设 0
8GB GPU编码后释放执行顺序:GPU 加载 4B → 生成 Conditioning → 保存到 CPU → 清空投影缓存 → 卸载编码器 → 原生 H3 节点才进行 VAE 编码与 DiT 采样。解决的是编码器与视频模型同时占用显存;不能消除 W4A8 主模型自身的采样临时张量峰值。CPU最低显存不占 GPU 但较慢;GPU流式适用纯文本;GPU常驻只适合大显存。强制规定执行顺序时用 ClipProj显存释放执行顺序输入/输出
05 — MATERIAL COPILOT
可视化素材编排器

嵌入式可视化节点:素材连接、@素材 想法编写、创作规格、服务配置、LLM 生成与中英文结果预览全部直接显示在节点本体。"资产管理"区可上传图片并在当前工作流中创建标准 LoadImage 节点自动连线,不修改 ComfyUI 内部文件。复用 PromptHelper 的运行模式、API 配置与代理设置;API 密钥不会写入面板结果或返回浏览器。

输入容量(与官方 MiniMaxH3ReferenceToVideo 对齐)
素材节点输入数量
图像图像_1图像_9最多 9 张
视频视频帧_1视频帧_3(Load Video 输出的 IMAGE 帧序列)最多 3 段
视频音轨视频音轨_1视频音轨_3(与同编号视频配对)最多 3 条
独立音频音频_1音频_3最多 3 条
基础想法示例
@Image1 的女孩与 @Image2 的面具女孩在咖啡馆发生争吵;
@Video1 提供快节奏追逐动作参考;
@Audio1 作为环境音乐风格参考。

要点

  • 直接处理模式不会假装已分析连接图片(ComfyUI 未执行时后端无法读取上游张量);需视觉 LLM 逐张分析时按常规方式执行该节点。
  • 视频素材抽取中间代表帧供视觉分析;音频不伪装已被听取,在 素材角色说明 中描述其情绪、节奏、音色。
  • 输出 素材清单@ImageN → <Picture N>@VideoN → <Video N>@AudioN → <Audio N>
06 — PROMPT HELPER
提示词助手

在线 API 模式

  • 运行模式=直接调用 API 输出三路:英文提示词(→ MiniMax-H3 prompt)、中文提示词(审阅/归档)、本地LLM指令(在线模式为空)。
  • 支持 OpenAI 兼容接口、Google Gemini 与 HTTP/Mixed 代理(如 http://127.0.0.1:7890);不支持 SOCKS 端口
  • API Key 建议环境变量:CLOSERAI_MINIMAXH3_API_KEYGOOGLE_API_KEY,避免保存进工作流。
  • 参考图 1-9 张;ReferenceImageBatch 输出接参考图输入,参与分析的图像数量 设为实际数量;顺序对应 <Picture 1><Picture 2>

本地 LLM 模式

运行模式=本地 LLM 指令 不发送网络请求。本地LLM指令 → 本地文本/视觉 LLM 节点 → LocalResultParser。本地模型必须返回:

<EN>
English MiniMax-H3 prompt
</EN>
<ZH>
中文提示词
</ZH>
07 — WIRING
标准 H3 图生视频接线
标准接线
Load Image → ImageResize+ → MiniMaxH3ImageToVideo.first_frame
PromptHelper.英文提示词 → MiniMaxH3ImageToVideo.prompt
CLIPLoader(CPU) → MiniMaxH3ImageToVideo.clip
Video VAE → MiniMaxH3ImageToVideo.vae
MiniMaxH3ImageToVideo → SamplerCustomAdvanced.latent_image

UNETLoader → Apply VDN-H3 → 通用LoRA-Pruned → BasicGuider.model
                                              → BasicScheduler.model
BasicScheduler(SIGMAS) → SamplerCustomAdvanced.sigmas
TurboSampler(SAMPLER) → SamplerCustomAdvanced.sampler
SamplerCustomAdvanced → Video/Audio VAE Decode → SaveVideo
Turbo 工作流必用
BasicScheduler: scheduler = simple, steps = 4, denoise = 1
SamplerCustomAdvanced.sampler: closerAI-minimaxH3-TurboSampler
不要继续用 KSamplerSelect=res_multistep 作为 4-step Turbo 采样器。视频/音频使用不同 flow schedule:TurboSampler 分别按视频 shift=12 / 音频 shift=3 推进。ComfyUI 0.31+ 中原生 ModelSamplingAV 已负责时间映射。不要使用 sa_solver(8GB、0.4MP、5 秒 W4A8 下可能在第一次 MLP 计算 OOM)。
8GB I2V 示例把 ClipProj显存释放 放在 MiniMaxH3ImageToVideo.LATENTSamplerCustomAdvanced.latent_image 之间,选 仅 ClipProj 编码器。动态显存模式自行管理 VAE 与 DiT;不要在每轮采样前强制卸载全部模型,否则 16GB 系统内存设备可能反复重建 10GB+ staged 权重、触发大量 Pin error,严重时 NVIDIA 驱动重置。
08 — LORA COMPATIBILITY
通用 LoRA-Pruned 与模型兼容性

原始 Turbo LoRA 为非剪枝 H3 训练(AdaLN 输入 2688 维);pruned_int8_convrot 的 AdaLN 输入为 8 维,两者不能直接合并。通用 LoRA-Pruned 注入兼容投影层与 pruned 8 维 AdaLN,跳过 2688 维权重,无匹配时直接报错;可串联多个,但不能宣称完整复现官方 4-step 效果。

底模与 LoRA 匹配表
底模可用 LoRA说明
*_pruned_int8_convrot.safetensors*_pruned_comfyui.safetensors推荐组合。pruned LoRA 无 AdaLN。
非剪枝 BF16 / 完整 INT8 ConvRot原始 minimax_h3_turbo_4step*.safetensors使用原始 2688 维 AdaLN LoRA。
本地 Q3 GGUF(当前 FL2VA/Ref2VA 文件)原始非 pruned Turbo LoRAQ3 GGUF 为非剪枝 2688 维结构,不能用 pruned LoRA。
GGUF 是否可用取决于其转换来源的网络结构,不取决于 .gguf 扩展名。不要把通用 LoRA-Pruned 接到非剪枝 GGUF。VDN 已开启内置 Turbo 8 步时通常不需要再外挂 Turbo LoRA,更适合外挂清晰度/动作/风格/角色 LoRA,推荐顺序 UNET加载器 → Apply VDN-H3 → 通用 LoRA-Pruned → Chunk FeedForward / 采样节点。效果 LoRA 从 0.5-0.8 起测,角色/风格从 0.7-1.0 起测。
通用 LoRA-Pruned 显存策略
策略适用显存行为
跟随低显存开关 + 开启 低显存逐层加载8GB普通投影与 AdaLN 按层临时上传,最稳但最慢。
混合 GPU 缓存8-16GB最近使用的普通投影保留 GPU,其他与 AdaLN 按层串流。
全部 GPU 常驻中高显存所有普通 LoRA 适配器常驻 GPU,最快。
8GB 起点:低显存逐层加载=开启LoRA加载策略=混合 GPU 缓存混合GPU缓存上限=0.25GB;稳定后依次试 0.35 / 0.50,第一次 OOM 回退到上一个稳定值。8GB 不应选"全部 GPU 常驻"
09 — CAMERA / LIGHT DESIGNER
可视化相机/光影设计器

节点名 closerAI H3 / 可视化相机/光影设计器。左右结构:左侧"相机设计 / 光影设计"页签切换参数,右侧同步切换操作界面。视频时长 4-15 秒自定义,内部自动换算 24fps 帧数。相机与光影属于提示词控制,不代表物理准确的法线重建或模型级光照控制。

推荐操作
操作链
基础提示词/提示词助手 → 可视化相机/光影设计器.基础提示词
选择运镜预设并编辑相机轨迹
选择光影应用方式和中文布光预设
        → 最终H3提示词 → MiniMaxH3ImageToVideo.prompt
声音策略行为
保留基础提示词中的音频默认。保留已有 overall_soundscapenon_diegetic_music,无则补充自然同步声音。
使用自定义音频使用节点中的自定义环境声、动作声和背景音乐。
明确静音只有此模式输出 Silence.N/A
光影应用方式行为
关闭光影设计默认,不注入额外光照约束。
生成光影设计不替换人物/场景/动作/相机/音频,加入新布光。
参考视频重打光锁定源视频相机、构图、身份与动作,只释放光影处理,要求高光/阴影/反射/轮廓光随时间一致。
最终H3提示词按 H3 官方字段结构融合:Full Reference 模式写入 detailed_description:;T2VA/I2VA 等写入 integrated_multimodal_description:人物表演与运镜从 0 秒开始沿同一时间轴同时执行,与设计轨迹冲突的独立镜头句会被移除。内置 12 种布光预设(柔和窗光、伦勃朗、冷暖双色、黄金时刻、清冷月光、霓虹双色、火光、舞台顶光、悬疑底光、三点布光、剪影逆光、阴天漫射)。360° 闭合轨迹可经 H3 Edit options 启用首尾锚定。
10 — 8GB GUIDE
8GB 显存建议
推荐起点
分辨率:约 0.4MP(例如 480 x 864)
时长:5 秒(约 124 帧)
采样:simple / 4 steps
文本编码器:CPU
TurboLoRA:低显存逐层加载,或 0.25GB 混合缓存

调参纪律

  • ReservedVRAMSetter 应放在模型链路中且输出实际接入后续模型节点;手动调参一次只改一个值
  • 降低保留显存 → GPU 常驻比例升高,更易 OOM;增大保留显存 → 更稳但更慢。
  • 不要同时开启 Turbo LoRA、Speed、Spectrum 等多个策略;每次仅启用一种,同 seed A/B 对比。
  • Speed / Spectrum 均为近似加速:快速运动、镜头切换、手指、文本、音画同步优先关闭。
  • 32B MiniMax H3 文本编码器保持 CPU;移到 8GB GPU 会挤占采样显存。
11 — SPACE-TIME TILED SAMPLER
时空分块二采样器

用于"低分辨率完整第一采样 → 视频潜空间放大 → 低 Sigma 第二采样"的高级工作流。前五个输入及前两个输出与 SamplerCustomAdvanced 兼容。不能替代第一采样(高噪声阶段需完整画面和时间范围建立人物/构图/运动/镜头逻辑)。1.1 版强制保持完整空间画幅,只对较长视频使用重叠时间窗口;旧 2×2 参数自动收敛为 1×1

8GB 稳定起点
显存策略:8GB稳定
时间分块:自动(8GB高分辨率默认17,重叠约5)
水平分块:1
垂直分块:1
空间重叠:0
接缝融合:Hann平滑
音频二采:保持输入音频(最稳定)
OOM自动降级:开启
最大重试次数:2
保持输入音频让每个时间窗口看到完整音频 latent,最终恢复第一采音频;联合二采并平均仅适合无对白或实验。普通 5 秒 H3 latent 默认不切时间;FI2VA 首尾关键帧按块重映射当前视为实验功能。配套示例:closerAI H3+sigma强化+潜空间放大+时空分块双采8GB示例0820.json 及 10 秒压力测试版。
12 — LONG VIDEO
长视频导演与分段素材时间线

可直接载入 example_workflows/closerAI-minimaxH3-20秒分段连续生成-8GB示例.json。长视频通过现有分段链逐段生成;导演支持最长 3600 秒、连续链最多 1024 段;超过 24 段的 LLM 剧本自动分块规划(每块最多 24 段)。

基本操作
长视频导演填写用户需求、总时长、每段目标时长。视频需求框可拖高;输入 @ 显示素材候选,方向键选择 Enter/Tab 插入。
上传或连接素材。生成时 @ImageN 按编号排序逐张独立识别;断开或忽略的素材不会发送;文件不可读时停止生成(不会跳过造成编号错位)。
每段卡片点击素材标签设置本段素材;变化说明填写人物入场/离场、场景替换、服装变化。
先选语言再点 生成分段剧本橙色标签=计划使用但未连接;已确认段落可锁定;重写本段 修复相邻连续状态且保持锁定段不变。
空间与物理连续性审计
边界模式规则
物理连续
continuous_motion
下一段起点必须精确等于上一段终点;跨楼层必须出现楼梯/电梯/扶梯/坡道,路径用时≤本段时长;运动上下文节点继承上一段尾帧。
有动机剪辑
motivated_cut
允许省略无法完整呈现的路程,但必须明确硬切/匹配剪辑等剪辑点;上下文节点自动跳过旧空间尾帧,防止走廊/窗户/楼层融化成新场景
新场景起点
new_scene_origin
不继承上一段运动上下文,用于真正独立新场景。相同人物跨场景需保身份时优先选有动机剪辑
审计发现断裂时自动让 LLM 完整修复一次;仍不合格则停止保存计划。例如"二楼走廊到操场"不能直接写"步伐未停走入操场"——需拆成 二楼走廊→楼梯入口→楼梯平台→一楼门厅→操场入口,或使用匹配剪辑。单纯把上下文从 5 帧提高到 22/39 帧不会修复错误空间路线。
长批次 / 进度预览 / 分支重生成

LongRunBatch 自动分批

  • 自动按显存:8GB=6段、12GB≈8段、16GB≈12段、24GB≈18段;30秒=1批,1分钟=2批,10分钟=20批。
  • 每批完成后执行图结束,预览节点确认队列空闲后自动提交下一批,从第一个缺失段开始。
  • 中间批次只提交分段 MP4/音频/检查点,最后一批才做最终无缝合成
  • 新版时序:8GB、每段 5 秒时每段固定采样 124 帧17n+5 网格对齐),首段 CPU 裁至 120 帧,后续段移除 5 帧上下文后补齐至 120——不再周期性制造 141 帧峰值

ProgressPreview 与 PostRunBranch

  • 预览节点只读:左侧只点亮已原子提交且 MP4 确实存在的段落;不替换正在播放的视频,不调 FFmpeg,不占 GPU。
  • 批次全部分段完成后选择不满意段,点 从本段分支重生成:原批次保持不变,新分支复制第 1~N-1 段、删除 N 及之后,从 N-1 上下文检查点恢复并自动生成到结尾,最后重新合成。
  • 断电/内存中断后,只要存在一个完整检查点,按钮自动显示 从第N段恢复;循环开始节点用当前外部音频执行最终指纹校验。
  • 固定名称续跑按计划哈希匹配:新计划不读取历史 batch_plan.json,自动进入新目录从第 1 段开始。
素材变化规则 / 单段转换 / 自动拼接

素材变化规则

  • 场景在第 3 段更换:第 2 段结尾须提前出现入口/光线/运动方向。
  • 人物在第 4 段更换:第 3 段让旧人物离场或交接;第 4 段独立定义新人物,禁止面部、服装、道具融合
  • 未在本段素材列表的参考不会被路由传给 H3(降低身份污染)。
  • 修改素材后计划失效并要求重新生成,避免旧提示词与新素材静默错配

转换为H3格式 / 自动无缝拼接

  • 转换为H3格式只调 LLM 处理当前段,保留原意和对白,只做结构编译;仅重写本段基于已有完整计划重新创作。
  • 转换请求只上传当前段已启用的参考图片;转换期间修改文本则旧响应被丢弃。
  • SeamlessChainAssemble 直接接收 manifest:按序读取分段,在 CPU/FFmpeg 处理冻结尾帧、交叉淡化与去点击,不增加 H3 采样显存。旧 ChainAssemble 不会被删除。
  • 旧检查点缺元数据时按 0 帧裁剪处理,保持可恢复性。
高速动态清晰增强(懒执行开关)
基于 MAINodes Motion Lab 的两遍生成:第一遍生成基础视频 → 高速动态分析找出运动过载区 → 动态时间放慢增加时间容量 → 局部去噪重绘 → 恢复画面 24fps 时间轴与音频时钟。默认关闭(只算基础分支);开启后推荐从 清晰忠实0.50 起测,细节重绘不足再试 平衡0.708GB 先用 480p、5 秒、单段测试;动态保持图可能把 124 帧扩展到 2-3 倍,不适合默认应用到每一段。基础音频保留比例=1.0 保留第一遍音频,发音稳定性通常优于二次生成。示例:0815-8GB-Turbo 版 / 0815-质量版(25 步,16~24GB 保片)。
13 — MANUAL TIMELINE DIRECTOR
手动长视频时间线导演

独立节点,不修改自动导演。输出相同的 H3_LONG_VIDEO_PLANH3_MATERIAL_BANK,可直接接入现有素材路由、递归生成、分批恢复、审片分支和最终拼接链。1080 像素固定高度三栏工作区(素材库 / 导演时间轨 / 分段编辑),右侧完整展开不用内部滚动条。

时间轴能力

  • 中栏下部按真实秒数显示分段块 / 画面轨 / 音频轨 / 提示词轨;转场类型独立工具栏 + 插入转场
  • 智能时长:开=LLM 按节拍/对白/动作复杂度/空间转移建议每段时长(限 4-15 秒,与目标总时长精确一致);关=保持当前固定分段时长。LLM 无时长字段时按动作数量/空间路径/复杂度计算,不静默回退 5 秒。
  • 智能时长下已锁定提示词的段也锁定当前时长,避免提示词与镜头长度失配。
  • 素材拖动中心=位置、左右边缘=起止、右上角柄=移动到其他段;靠近已有边缘自动吸附;时间重叠的素材自动上下并行显示 并行
  • 越界:联动 / 限制控制拖出分段右缘行为;长时间线视口虚拟化只绘制可见区域+缓冲区。
  • 多选 Ctrl/Cmd+单击Shift 连选、Ctrl/Cmd+ADelete 批删、方向键 0.1s / Shift 1s 微调;80 步历史支持撤销重做。

精确素材时间与预检

  • 精确素材时间(自动子段):素材边界把可见分段编译成隐藏 H3 执行子段,各子段只路由当时有效素材;空窗保持为空不继承。内部边界强制连续运动上下文,最终交付时长与手动分段一致。会增加实际采样次数(建议每子段 ≥0.75 秒)。
  • 整段参考(兼容):所有素材影响整个采样段,适合不希望增加采样次数的项目。
  • 修改时长/想法/素材/范围/转场/物理连续后提示词标记过期严格检查 阻止旧提示词执行;锁定提示词 后允许执行,依赖再变化显示"手动锁定·依赖已变化"。
  • 预检 检查空提示词、过期依赖、未连接素材、过短精确子段;保存执行同一套检查,严格错误修复前不显示"可执行工作流"。
  • 本地 LLM 调用后卸载显存开关仅当接口地址为 localhost/127.0.0.1/::1 时执行;Ollama 自动调 /api/generate 并发送 keep_alive=0
  • 入场转场进入检查点元数据与自动装配:交叉淡化 按边界时长换算帧并同步音频;硬切/匹配剪辑/无转场/新场景不执行画面淡化。
手动版示例工作流
closerAI minimax_h3低显存FI2VA手动时间线长视频工作流0815.json
closerAI minimax_h3低显存Ref2VA手动时间线长视频工作流0815.json
# 均基于 ClipProj 0.1.13 长任务自动分批恢复版克隆,只替换导演节点
14 — FAQ
常见问题
显存不足。先降低分辨率、时长或混合缓存预算;然后提高保留显存让更多 H3/VAE 权重卸载到 CPU。不要先提高采样步数。
不要用普通 LoRA 加载器把原始 Turbo LoRA 接到 pruned 模型。使用 closerAI-minimaxH3-TurboLoRA-Pruned,它会跳过结构不兼容的 AdaLN 权重。
确认模型支持视觉输入、代理为 HTTP/Mixed 地址、参考图数量与分辨率适中。节点会压缩图片并重试短暂连接故障,但服务端图文限制和不稳定代理仍可能失败。
第三方声明:Spectrum 运行时遵循 GPL-3.0-or-later;TurboSampler 的双调度算法参考 Larryvrh 的 Apache-2.0 项目。详见 THIRD_PARTY_NOTICES.md
closerAI · minimaxH3-Helper 套件

COMFYUI CUSTOM NODES SUITE · 27+ NODES · FRAME RULE 17n+5 · LONG VIDEO UP TO 3600s / 1024 SEGMENTS
DOES NOT MODIFY COMFYUI SOURCE · OLD NODE IDS PRESERVED

操作成功

隐藏内容
本内容需权限查看
  • 普通用户: 599金币
  • VIP会员: 免费
  • 永久会员: 免费

主题授权提示:请在后台主题设置-主题授权-激活主题的正版授权,授权购买:RiTheme官网

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。