Kijai 放出 MiniMax-H3 加速 LoRA:381MB 起,12GB 显存两步出片

Kijai 开源 MiniMax-H3 的 PDMD 加速 LoRA,2-Step 仅 381MB、4-Step 559MB,把推理从数十步压到 2/4 步,并给出 8GB 到 24GB 以上各档显卡的配置、部署路径与参数要点。

本地视频生成长期受制于算力,这一局面正在被改写。

MiniMax-H3 开源之后,凭借原生音视频同步、24fps 影视级运动幅度,加上首尾帧控制(FL2VA)与多模态参考(Ref2VA),很快站到了开源视频生成的第一梯队。但它原生推理要跑数十步迭代,显存开销也极大,只配了消费级显卡的本地创作者基本被挡在门外:要么转去租云端算力,要么在本地看着显存被吃满、程序报错。

转机来自 ComfyUI 生态的核心开发者 Kijai。他在 Hugging Face 仓库(Kijai/MiniMax-H3-experimental/loras)放出了一组专为 MiniMax-H3 做的 PDMD 加速 LoRA,几个关键点很直接:

  • 模型体积极小:2-Step 只有 381 MB,4-Step 为 559 MB;
  • 步数压到极限:从数十步直接降到 2 步或 4 步;
  • 消费级显卡解禁:12GB 显存的卡不必再当旁观者,普通个人工作站也能跑高品质本地视频渲染。

这次更新不只是把权重裁小,而是在计算路径与显存占用两头同时下手的模型蒸馏成果:

Kijai / MiniMax-H3-experimental / loras

├── minimax_h3_pdmd_2step_lora_avg_rank_38_bf16.safetensors (381 MB)

└── minimax_h3_pdmd_4step_lora_avg_rank_57_bf16.safetensors (559 MB)

PDMD(Progressive Distillation / Multi-step Diffusion Distillation)采用渐进式轨迹蒸馏算法,把扩散模型在潜空间里的去噪演变路径重新组织了一遍。原先要反复校正 30~50 次的数值积分,被它拟合成 2 次或 4 次高度浓缩的大步长跃迁,推理耗时因此下降了一个数量级。

  • 2-Step 版本:走 Rank 38 的轻量路线,文件 381 MB,主要抽取主干网络中运动趋势与全局结构最关键的低秩矩阵;
  • 4-Step 版本:Rank 提到 57,体积 559 MB,在把推理周期大幅压缩的同时,保留了更完整的高频几何边缘与纹理细节。

两个版本都用原生 BF16 格式,保证运算中的动态数值范围,避免低步数下出现明显画面溢出或噪点坍塌。

再配合 Kijai 仓库里的套件组合,比如 W4A8/W6A8 量化主干、INT8 ConvRot 视频 VAE、Qwen3-VL 文本编码器量化版,MiniMax-H3 的显存门槛被整体拉低。以下是目前主流消费级显卡的实测配置梯队与运行策略。

12GB 显存档

代表显卡:RTX 5070 12GB、RTX 4070 / 4070 Super / 4070 Ti 12GB、RTX 3060 12GB、RTX 3080 12GB

运行策略:

  • 主干组合:W4A8 Mixed 剪枝主模型 + INT8 ConvRot 轻量 VAE;
  • 文本编码器:选 NVFP4 / AWQ 量化版本;
  • 输出规格:初始分辨率建议 960×544(5 秒视频预览),进阶再测 1344×768(768p);
  • 实际表现:有 2-Step / 4-Step LoRA 加持,12GB 显存全程不溢出,单段 5 秒视频的生成时间从数分钟级压到几十秒内,RTX 3060 12GB 这类老卡用户也能顺畅跑。

16GB 显存档

代表显卡:RTX 4070 Ti Super 16GB、RTX 4080 / 4080 Super 16GB、RTX 5080 16GB、RTX 4060 Ti 16GB

  • 主干组合:可以选精度更高的 W6A8 或 FP8 主干模型,搭配 4-Step LoRA;
  • 输出规格:768p 原生点对点画质输出可以稳定承载,显存更富余时还能开启多图参考(Ref2VA)通道;
  • 实际表现:吞吐很快,在新架构显卡(如 5080/4080)上,4 步推理几乎瞬时完成。

24GB 及以上档

代表显卡:RTX 3090 / RTX 3090 Ti / RTX 4090 / RTX 5090

  • 主干组合:不必做激进的模型切片,可尝试载入接近原生精度的 Transformer,再配 2-step 或 4-step LoRA,把单帧出片速度压到极限;
  • 输出规格:满血 15 秒长镜头渲染或连续批量抽卡都支持,生成耗时缩到极短周期。

8~10GB 显存档

代表显卡:RTX 4060 8GB、RTX 3070 / 3070 Ti 8GB、RTX 3080 10GB

  • 主干组合:必须打开 ComfyUI 的 CPU/GPU 极端内存切片调度(Offload),同时搭配极限量化 GGUF / W4A8 与低分辨率模式;
  • 体验建议:虽然有系统内存交换的开销,但在 2 步去噪的加持下,推理总时间仍在可接受范围内。

部署步骤

先把 ComfyUI 更新到最新版(建议 0.31.0 以上,以保证对 W4A8 与 INT8 ConvRot 的算子支持完整):

  • LoRA 路径:在 ComfyUI/models/loras/ 放入
  • Diffusion Model 路径:在 ComfyUI/models/diffusion_models/ 放入对应主干模型(如 minimax_h3_fl2va_pruned_w4a8_mixed.safetensors)
  • Text Encoder 路径:在 ComfyUI/models/text_encoders/ 放入量化版文本编码器(如 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors)
  • VAE 路径:在 ComfyUI/models/vae/ 放入 minimax_h3_video_vae_int8_convrot.safetensors

节点连接:

  • 加载主干模型:用 UNETLoader(或专用 H3 Loader)载入量化主模型;
  • 挂载加速 LoRA:后接 LoraLoaderModelOnly 节点,载入对应 PDMD LoRA,强度建议 0.8 ~ 1.0;
  • 采样器连接:把处理后的 Model 输出接到 KSampler 或 H3 专用采样通道。

参数要点

  • Steps(步数):不能随意设。挂 2-step LoRA 时步数必须是 2;挂 4-step LoRA 时必须设成 4;
  • CFG(引导尺度):一定要压低。蒸馏模型对高 CFG 极为敏感,建议 1.0 ~ 1.5,超过 2.0 容易出现画面过曝或纹理烧焦;
  • Sampler / Scheduler 搭配:推荐官方兼容的 res_multistep 采样器加 simple 调度策略;
  • 分辨率梯度渐进:第一次测试先用 544p 把链路跑通,确认不报错再升到 768p 生成正片。

两个版本怎么选

对比维度 2-Step LoRA (381 MB) 4-Step LoRA (559 MB)
生成速度 极速,相较基模加速约 10~15 倍 快速,相较基模加速约 5~8 倍
动态表现 镜头推拉、基础肢体动作准确到位 连续运动更平滑,时空一致性更高
微观细节 复杂背景纹理略有简化 毛发、面部微表情、光影层次完整度高
典型适用场景 快速验证提示词、分镜草图筛选、批量构图 商业短片分镜正片、成片渲染导出

对应到实际工作流,可以分成两条:

  • 极速验证流:用 2-step 配 544p 分辨率,10 秒内快速过审镜头概念;
  • 终选交付流:锁定满意的种子(Seed)与动作后,切到 4-step、768p 生成成片,必要时串联轻度放大工作流,兼顾效率与画质。

从过去动辄要数十 GB 显存的集群算力,到现在 300MB+ 级别的 LoRA 让消费级显卡两步成片,开源社区又一次说明了工程优化与算法蒸馏的分量。技术壁垒被开发者不断踩平,算力焦虑也在一次次代码提交中被化解。显卡已经就绪,打开 ComfyUI,就可以开始做自己的第一支极速 AI 镜头。

欢迎在评论区分享 Kijai 这个版本的测试体验。

分享 微博

弹幕

还没有弹幕,来说一句。

到此一游

共 0 条

还没有人留下足迹,来签个到。

    评论 共 0 条

      昵称 —