Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-INT8-ConvRot开发者指南:模型转换与定制化教程

【免费下载链接】Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot 【免费下载链接】Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot 项目地址: https://ai.gitcode.com/hf_mirrors/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot

Qwen3-VL-32B Ultra Uncensored Heretic — MiniMax-H3 ComfyUI INT8 ConvRot是一个基于Qwen3-VL-32B模型构建的ComfyUI专用INT8量化版本,专为开发者提供高效的图像-文本处理能力。本指南将详细介绍模型的转换流程、安装配置及定制化方法,帮助开发者快速上手并充分利用这一强大工具。

模型核心组件解析

该项目包含两个关键的 safetensors 文件,均基于llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic构建:

MiniMax-H3 条件编码器

  • 文件路径qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_int8_convrot.safetensors
  • 大小:26,363,476,151 bytes (24.55 GiB)
  • 核心特性:包含语言层0-49、完整视觉塔及Qwen3-VL嵌入,采用INT8 ConvRot量化技术,350个学习型行级INT8 ConvRot语言矩阵,组大小256,551个BF16保留张量(含完整视觉塔和所有归一化层)。

可选生成尾层

  • 文件路径qwen3vl_32b_minimax_h3_generation_tail_50_63_int8_convrot.safetensors
  • 大小:7,609,128,707 bytes (7.09 GiB)
  • 核心特性:包含语言层50-63、最终语言归一化层和LM头,98个学习型行级INT8 ConvRot矩阵,组大小256,57个BF16保留张量,用于提示增强。

快速安装与配置步骤

环境准备

确保您的系统满足以下要求:

  • ComfyUI 提交版本:14b05228cef127ce529bc0c08660770d4af3e9a8
  • 依赖包:comfy-kitchen==0.2.26comfy-aimdo==0.4.11
  • PyTorch 版本:2.8.0+cu128(推荐CUDA 13.0+以获得优化内核)
  • 硬件要求:NVIDIA GeForce RTX 5090(32 GB VRAM)

安装步骤

  1. 克隆仓库

    git clone https://gitcode.com/hf_mirrors/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot
    
  2. 放置模型文件 将两个 safetensors 文件复制到 ComfyUI 的文本编码器目录:

    ComfyUI/models/text_encoders/MiniMax-H3/
    
  3. 加载模型 在 ComfyUI 中使用 CLIPLoader,选择类型为 minimax(MiniMax-H3),确保已安装 ComfyUI 及其固定依赖 comfy-kitchen

模型转换全流程

转换工具与参数

模型转换使用 silveroxides/convert_to_quant 1.3.1 工具,采用 AdamW AdaRound 优化和提前停止策略,而非简单舍入。以下是核心转换命令:

条件编码器转换
env PYTHONPATH=.deps python .deps/bin/ctq \
  -i qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_bf16.safetensors \
  -o qwen3vl_32b_minimax_h3_ultra_uncensored_heretic_int8_convrot.safetensors \
  --int8 \
  --scaling_mode row \
  --convrot \
  --convrot-group-size 256 \
  --comfy_quant \
  --save-quant-metadata \
  --custom-layers '^model\.embed_tokens\.weight$' \
  --custom-type int8 \
  --custom-scaling-mode tensor \
  --custom-simple \
  --exclude-layers '^visual\.' \
  --low-memory \
  --device cuda \
  --manual-seed 42 \
  --num-iter 4000 \
  --optimizer adamw \
  --verbose NORMAL
生成尾层转换
env PYTHONPATH=.deps .deps/bin/ctq \
  -i qwen3vl_32b_minimax_h3_generation_tail_50_63_bf16.safetensors \
  -o qwen3vl_32b_minimax_h3_generation_tail_50_63_int8_convrot.safetensors \
  --int8 \
  --scaling_mode row \
  --convrot \
  --convrot-group-size 256 \
  --comfy_quant \
  --save-quant-metadata \
  --low-memory \
  --device cuda \
  --manual-seed 42 \
  --num-iter 4000 \
  --optimizer adamw \
  --verbose NORMAL \
  --layer-config tools/qwen3vl32b_generation_tail_quant.json \
  --fullmatch

转换关键参数解析

  • --int8:启用INT8量化
  • --convrot:应用ConvRot量化技术
  • --convrot-group-size 256:设置ConvRot组大小为256
  • --low-memory:启用低内存模式,适合大模型转换
  • --num-iter 4000:设置优化迭代次数为4000
  • --optimizer adamw:使用AdamW优化器

定制化使用指南

提示增强配置

若需使用提示增强功能,请按以下步骤操作:

  1. 使用 ComfyUI 标准 CLIPLoader 加载 0-49 层条件检查点,类型选择 minimax
  2. 将加载的 CLIP 连接到 MiniMax H3 Prompt Enhancer (optional CLIP tail) 节点。
  3. 在节点的 clip_tail 下拉菜单中选择 50-63 尾层。
  4. enhanced_prompt 和返回的未更改 clip 发送到常规 MiniMax-H3 引导节点。

运行时验证

转换后的模型通过以下验证:

  • 检测到模型类:MiniMaxH3TEModel_
  • 条件输出:(1, 12, 5120)(有限值)
  • 正确的 minimax_token_tags(12,)
  • 编码后VRAM使用:约24.7 GiB已分配 / 26.1 GiB已保留
  • 标准 CLIPLoader 加载条件模型,包含50个语言层,无最终归一化层或LM头

模型来源与验证

上游来源

  • 固定上游源
    repository: llmfan46/Qwen3-VL-32B-Instruct-ultra-uncensored-heretic
    revision:   c44b949b30d111666a5ed9851c5cd633ed39b070
    
  • 上游BF16分片在该修订版下载,并在打包前根据其Hugging Face LFS SHA-256值进行验证。

模型特性

  • Heretic v1.2.0 ARA编辑,针对语言层31-40的attn.o_proj
  • 编辑层位于MiniMax-H3保留的0-49范围内,因此去审查编辑在此检查点中存在
  • 来源报告:4/100拒绝率(原始模型为99/100),KL散度0.0421,PIQA 92.87%,MMLU 79.87%

结构验证

  • 完成文件通过了每个张量、数据类型、形状、比例、每层描述符和全局量化元数据条目的结构验证。
  • 所有551个受保护的BF16张量与打包的BF16源进行逐字节比较,未发生变化。
  • 尾层同样通过精确结构验证,57个BF16张量(304,128字节)与源完全相同。

常见问题解决

VRAM不足问题

若遇到VRAM不足,可尝试:

  • 确保使用低内存模式(--low-memory)转换模型
  • 关闭其他占用GPU内存的应用程序
  • 考虑使用更小的ConvRot组大小(需重新转换模型)

模型加载失败

  • 检查模型文件是否完整,可通过SHA256SUMS文件验证
    sha256sum -c SHA256SUMS
    
  • 确保ComfyUI及依赖包版本符合要求
  • 验证模型文件路径是否正确放置在 ComfyUI/models/text_encoders/MiniMax-H3/

总结

Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-INT8-ConvRot通过高效的INT8 ConvRot量化技术,在保持模型性能的同时显著降低了内存占用,使其能够在32GB VRAM的GPU上运行。本指南详细介绍了模型的安装、转换和定制化方法,帮助开发者快速集成这一强大的图像-文本处理工具到ComfyUI工作流中。无论是进行条件编码还是提示增强,该模型都能提供高效可靠的性能,满足各类AI应用开发需求。

【免费下载链接】Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot 【免费下载链接】Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot 项目地址: https://ai.gitcode.com/hf_mirrors/ethanfel/Qwen3-VL-32B-Ultra-Heretic-MiniMax-H3-ComfyUI-INT8-ConvRot

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐