Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-INT8-ConvRot开发者指南:模型转换与定制化教程
Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-INT8-ConvRot开发者指南:模型转换与定制化教程
Qwen3-VL-32B Ultra Uncensored Heretic — MiniMax-H3 ComfyUI INT8 ConvRot是一个基于Qwen3-VL-32B模型构建的ComfyUI专用INT8量化版本,专为开发者提供高效的图像-文本处理能力。本指南将详细介绍模型的转换流程、安装配置及定制化方法,帮助开发者快速上手并充分利用这一强大工具。
模型核心组件解析
该项目包含两个关键的 safetensors 文件,均基于llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic构建:
MiniMax-H3 条件编码器
- 文件路径:
qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_int8_convrot.safetensors - 大小:26,363,476,151 bytes (24.55 GiB)
- 核心特性:包含语言层0-49、完整视觉塔及Qwen3-VL嵌入,采用INT8 ConvRot量化技术,350个学习型行级INT8 ConvRot语言矩阵,组大小256,551个BF16保留张量(含完整视觉塔和所有归一化层)。
可选生成尾层
- 文件路径:
qwen3vl_32b_minimax_h3_generation_tail_50_63_int8_convrot.safetensors - 大小:7,609,128,707 bytes (7.09 GiB)
- 核心特性:包含语言层50-63、最终语言归一化层和LM头,98个学习型行级INT8 ConvRot矩阵,组大小256,57个BF16保留张量,用于提示增强。
快速安装与配置步骤
环境准备
确保您的系统满足以下要求:
- ComfyUI 提交版本:
14b05228cef127ce529bc0c08660770d4af3e9a8 - 依赖包:
comfy-kitchen==0.2.26、comfy-aimdo==0.4.11 - PyTorch 版本:
2.8.0+cu128(推荐CUDA 13.0+以获得优化内核) - 硬件要求:NVIDIA GeForce RTX 5090(32 GB VRAM)
安装步骤
-
克隆仓库
git clone https://gitcode.com/hf_mirrors/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot -
放置模型文件 将两个 safetensors 文件复制到 ComfyUI 的文本编码器目录:
ComfyUI/models/text_encoders/MiniMax-H3/ -
加载模型 在 ComfyUI 中使用
CLIPLoader,选择类型为minimax(MiniMax-H3),确保已安装 ComfyUI 及其固定依赖comfy-kitchen。
模型转换全流程
转换工具与参数
模型转换使用 silveroxides/convert_to_quant 1.3.1 工具,采用 AdamW AdaRound 优化和提前停止策略,而非简单舍入。以下是核心转换命令:
条件编码器转换
env PYTHONPATH=.deps python .deps/bin/ctq \
-i qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_bf16.safetensors \
-o qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_int8_convrot.safetensors \
--int8 \
--scaling_mode row \
--convrot \
--convrot-group-size 256 \
--comfy_quant \
--save-quant-metadata \
--custom-layers '^model\.embed_tokens\.weight$' \
--custom-type int8 \
--custom-scaling-mode tensor \
--custom-simple \
--exclude-layers '^visual\.' \
--low-memory \
--device cuda \
--manual-seed 42 \
--num-iter 4000 \
--optimizer adamw \
--verbose NORMAL
生成尾层转换
env PYTHONPATH=.deps .deps/bin/ctq \
-i qwen3vl_32b_minimax_h3_generation_tail_50_63_bf16.safetensors \
-o qwen3vl_32b_minimax_h3_generation_tail_50_63_int8_convrot.safetensors \
--int8 \
--scaling_mode row \
--convrot \
--convrot-group-size 256 \
--comfy_quant \
--save-quant-metadata \
--low-memory \
--device cuda \
--manual-seed 42 \
--num-iter 4000 \
--optimizer adamw \
--verbose NORMAL \
--layer-config tools/qwen3vl32b_generation_tail_quant.json \
--fullmatch
转换关键参数解析
--int8:启用INT8量化--convrot:应用ConvRot量化技术--convrot-group-size 256:设置ConvRot组大小为256--low-memory:启用低内存模式,适合大模型转换--num-iter 4000:设置优化迭代次数为4000--optimizer adamw:使用AdamW优化器
定制化使用指南
提示增强配置
若需使用提示增强功能,请按以下步骤操作:
- 使用 ComfyUI 标准
CLIPLoader加载 0-49 层条件检查点,类型选择minimax。 - 将加载的 CLIP 连接到 MiniMax H3 Prompt Enhancer (optional CLIP tail) 节点。
- 在节点的
clip_tail下拉菜单中选择 50-63 尾层。 - 将
enhanced_prompt和返回的未更改clip发送到常规 MiniMax-H3 引导节点。
运行时验证
转换后的模型通过以下验证:
- 检测到模型类:
MiniMaxH3TEModel_ - 条件输出:
(1, 12, 5120)(有限值) - 正确的
minimax_token_tags:(12,) - 编码后VRAM使用:约24.7 GiB已分配 / 26.1 GiB已保留
- 标准
CLIPLoader加载条件模型,包含50个语言层,无最终归一化层或LM头
模型来源与验证
上游来源
- 固定上游源:
repository: llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic revision: c44b949b30d111666a5ed9851c5cd633ed39b070 - 上游BF16分片在该修订版下载,并在打包前根据其Hugging Face LFS SHA-256值进行验证。
模型特性
- Heretic v1.2.0 ARA编辑,针对语言层31-40的
attn.o_proj - 编辑层位于MiniMax-H3保留的0-49范围内,因此去审查编辑在此检查点中存在
- 来源报告:4/100拒绝率(原始模型为99/100),KL散度0.0421,PIQA 92.87%,MMLU 79.87%
结构验证
- 完成文件通过了每个张量、数据类型、形状、比例、每层描述符和全局量化元数据条目的结构验证。
- 所有551个受保护的BF16张量与打包的BF16源进行逐字节比较,未发生变化。
- 尾层同样通过精确结构验证,57个BF16张量(304,128字节)与源完全相同。
常见问题解决
VRAM不足问题
若遇到VRAM不足,可尝试:
- 确保使用低内存模式(
--low-memory)转换模型 - 关闭其他占用GPU内存的应用程序
- 考虑使用更小的ConvRot组大小(需重新转换模型)
模型加载失败
- 检查模型文件是否完整,可通过SHA256SUMS文件验证
sha256sum -c SHA256SUMS - 确保ComfyUI及依赖包版本符合要求
- 验证模型文件路径是否正确放置在
ComfyUI/models/text_encoders/MiniMax-H3/
总结
Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-INT8-ConvRot通过高效的INT8 ConvRot量化技术,在保持模型性能的同时显著降低了内存占用,使其能够在32GB VRAM的GPU上运行。本指南详细介绍了模型的安装、转换和定制化方法,帮助开发者快速集成这一强大的图像-文本处理工具到ComfyUI工作流中。无论是进行条件编码还是提示增强,该模型都能提供高效可靠的性能,满足各类AI应用开发需求。
更多推荐

所有评论(0)