一、引言

想在自己电脑上跑一个能输入文字自动生成视频的 AI 模型吗?文本生成视频(Text-to-Video Synthesis)已经不再是实验室里的黑科技。本文以 ModelScope 社区提供的开源模型为例,手把手带你在一台 Windows 10 + NVIDIA 显卡 + 16GB 显存、128GB 内存的 PC 上完成本地搭建。全程步骤细化到点击、复制粘贴,保证零基础也能跟着跑通。

二、环境准备

2.1 硬件要求

  • 显卡:NVIDIA 显卡,建议显存 ≥ 12GB(16GB 更佳),本文以 16GB 显存为基准测试。
  • 内存:128GB 完全够用,模型推理主要占用显存。
  • CPU:志强(Zenon)系列,不是瓶颈。
  • 系统:Windows 10 专业版 / 家庭版均可。

2.2 软件清单(按安装顺序)

  1. Python 3.10(推荐 3.10.11,兼容性最佳)
  2. NVIDIA 显卡驱动(最新 Game Ready 驱动)
  3. CUDA 11.8(或 12.1,本文以 11.8 为例)
  4. cuDNN 8.9.5(对应 CUDA 11.8)
  5. Git(可选,用于拉取某些仓库)
  6. 核心框架:PyTorch、ModelScope、ffmpeg 等

2.3 安装流程图与依赖关系

下图直观展示了从零开始到成功运行的完整路径,箭头表示严格的安装顺序依赖关系。请按照箭头方向逐步完成,不要跳过或颠倒顺序。

flowchart TD
    A["开始:Windows 10 + NVIDIA 16G 显卡"] --> B["3.1 安装 Python 3.10"]
    B --> C["3.2 安装 NVIDIA 显卡驱动"]
    C --> D["3.3 安装 CUDA 11.8"]
    D --> E["3.4 安装 cuDNN 8.9.5"]
    E --> F["3.5 创建虚拟环境 t2v_env"]
    F --> G["3.6 安装 PyTorch CUDA 版"]
    G --> H["3.7 安装 ModelScope + 依赖"]
    H --> I["3.8 安装 ffmpeg"]
    I --> J["3.9 下载模型 and 运行脚本"]
    J --> K["第四章 性能调优 and 测试"]
    K --> L["完成:本地文本生成视频"]

关键依赖关系速查表:

步骤 依赖前提 为后续提供
3.1 Python 3.10 Windows 10 系统 pip、虚拟环境
3.2 NVIDIA 驱动 NVIDIA 显卡硬件 GPU 基础支持
3.3 CUDA 11.8 3.2 显卡驱动 GPU 并行计算库
3.4 cuDNN 3.3 CUDA 11.8 深度学习算子加速
3.5 虚拟环境 3.1 Python 3.10 隔离的包管理空间
3.6 PyTorch 3.3+3.4+3.5 深度学习框架
3.7 ModelScope 3.5+3.6 PyTorch 模型下载与 pipeline
3.8 ffmpeg 3.5 虚拟环境 视频编码与合成
3.9 下载运行模型 3.1~3.8 全部完成 生成视频输出

上面的表格可以帮助你在遇到报错时快速定位问题出在哪一步,以及哪些前置步骤需要重新检查。

三、详细安装步骤(小白照着做)

3.1 安装 Python 3.10

1. 打开浏览器,访问 Python 3.10.11 下载页,往下找到 Windows installer (64-bit),点击下载。

2. 双击运行安装包,务必勾选「Add Python 3.10 to PATH」,然后点击「Install Now」。

3. 安装完成后,按下键盘 Win + R,输入 cmd 回车,在命令行里输入 python --version,出现版本号即成功。

3.2 安装 NVIDIA 显卡驱动

1. 打开 NVIDIA 驱动下载,手动选择或使用自动检测下载最新驱动。

2. 下载后双击安装,选择「NVIDIA 图形驱动程序」和「GeForce Experience」,一路下一步,安装完成后重启电脑。

3. 重启后,在命令行输入 nvidia-smi,如果能显示显卡信息、驱动版本和 CUDA 版本(如 CUDA Version:12.5),说明驱动安装成功。

3.3 安装 CUDA 11.8

1. 打开 CUDA 11.8 下载存档

2. 依次选择:Operating System → Windows,Architecture → x86_64,Version → 10(或你的 Windows 版本),Installer Type → exe(local)

3. 下载后双击安装,选择「精简」安装(默认),一路下一步直至完成。

4. 验证:打开命令行,输入 nvcc -V,如果出现版本号 11.8 即成功。如果没有,需要手动把 C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8\binlibnvvp 加到系统环境变量 Path 中。

3.4 安装 cuDNN 8.9.5

1. 前往 cuDNN 存档页,需要注册 NVIDIA 开发者账号(免费)。

2. 选择 Download cuDNN v8.9.5 (June 1st, 2023), for CUDA 11.x,然后下载 cuDNN for Windows 的 zip 包。

3. 解压后得到三个文件夹 (bin, include, lib),将这三个文件夹内的文件分别复制到 CUDA 安装目录下的对应文件夹(默认路径 C:\Program Files\NVIDIA GPU Computing Toolkit\CUDA\v11.8):

  • bin 里的 .dll 文件 → CUDA 的 bin 里
  • include 里的 .h 文件 → CUDA 的 include 里
  • lib 里的 .lib 文件 → CUDA 的 lib 里

4. 不需要额外设置环境变量(如果 CUDA 的环境变量已经配好)。

3.5 创建虚拟环境(强烈推荐)

1. 在任意文件夹空白处按住 Shift 点鼠标右键,选择「在此处打开 PowerShell 窗口」或「命令窗口」,输入:

python -m venv t2v_env

2. 激活环境:

.\t2v_env\Scripts\activate

看到命令行最前面出现 (t2v_env) 就说明激活成功。之后所有的包都装在这个环境里。

3.6 安装 PyTorch(CUDA 版)

1. 打开 PyTorch 官网,根据你的 CUDA 版本生成安装命令。对于 CUDA 11.8,命令类似:

pip install torch==2.0.1+cu118 torchvision==0.15.2+cu118 torchaudio==2.0.2 -f https://download.pytorch.org/whl/torch_stable.html

如果官网生成的是 2.1 或更高版本且兼容 CUDA 11.8,也可以安装。

2. 验证:在激活的虚拟环境中输入 python,然后一行一行输入:

import torch
print(torch.cuda.is_available())

打印 True 表示 GPU 可用。

3.7 安装 ModelScope 核心库和其他依赖

pip install modelscope opencv-python imageio imageio-ffmpeg

这里顺便安装了 opencv 和 imageio,因为文本生成视频模型在合成视频时需要写帧。

3.8 安装 ffmpeg

很多模型在生成视频后需要调用 ffmpeg 进行编码。推荐使用 imageio-ffmpeg 插件,上面已安装,一般不需要额外安装 ffmpeg。但如果模型直接调用系统 ffmpeg,需要额外安装:

  1. 访问 ffmpeg Windows builds,下载 ffmpeg-release-full.7z
  2. 解压到比如 C:\ffmpeg,然后将 C:\ffmpeg\bin 添加到系统 PATH 环境变量。
  3. 命令行输入 ffmpeg -version 验证。

3.9 下载并运行 ModelScope 文本生成视频模型

本教程使用 ModelScope 官方模型 damo/Text-to-Video-Synthesis,可以直接通过 pipeline 调用。

1. 在激活的虚拟环境中,创建一个 Python 脚本文件 t2v_demo.py,使用记事本打开,输入以下内容:

from modelscope.outputs import OutputKeys
from modelscope.pipelines import pipeline
from modelscope.utils.constant import Tasks
创建文本生成视频 pipeline,模型首次运行会自动下载
p = pipeline(
task=Tasks.text_to_video_synthesis,
model='damo/Text-to-Video-Synthesis'
)
输入文字描述
test_text = "A tranquil sunset over the ocean with gentle waves, cinematic lighting."
output_video_path = p(test_text)[OutputKeys.OUTPUT_VIDEO]
print("视频已生成,路径:", output_video_path)

2. 运行脚本:

python t2v_demo.py

脚本会:

  • 自动从 ModelScope 下载模型权重(约 2-3GB),下载一次后缓存。
  • 加载模型进行推理,生成视频文件(通常为 mp4 格式),存放在临时目录,并在控制台打印路径。

注意:首次运行下载速度取决于网络,建议耐心等待。如果下载失败,可以尝试设置镜像或手动下载后再加载(见踩坑点)。

四、性能调优:必改参数与设置

默认配置可能在 16GB 显存下可运行,但为了获得更好的效果或避免爆显存,需要调整几项关键参数。

4.1 视频分辨率

在创建 pipeline 时可以传入 model_kwargs 来修改分辨率,例如:

p = pipeline(
    task=Tasks.text_to_video_synthesis,
    model='damo/Text-to-Video-Synthesis',
    model_revision='v1.0.0',  # 指定版本,避免默认变动
    model_kwargs={"video_length": 32, "num_frames": 32, "resolution": "256x256"}
)

如果显存不足,建议将分辨率设为 "256x256";如果显存较充裕,可以尝试 "384x256""512x320",但帧数和分辨率是显存大户。

4.2 帧数(video_length / num_frames)

生成的视频帧数越多,动作越流畅,但显存占用成倍增加。默认一般为 16 帧,可以手动设为 32 帧。如果遇到 out of memory,首先减少帧数到 16 甚至 8。

4.3 推理精度(fp16 混合精度)

PyTorch 支持自动混合精度(AMP),可以在不改变代码的情况下大幅降低显存占用。在推理脚本开头添加:

import torch
torch.backends.cudnn.benchmark = True
torch.cuda.amp.autocast(enabled=True)

或者在加载模型时指定 torch_dtype=torch.float16,但该模型 pipeline 可能不直接支持,最稳妥的方法是使用 autocast 上下文管理器包围生成语句。

4.4 模型缓存路径

ModelScope 默认将模型下载到 C:\Users\用户名\.cache\modelscope\hub,如果 C 盘空间紧张,可以通过环境变量修改:

set MODELSCOPE_CACHE=D:\modelscope_cache

或写入系统环境变量永久生效。

4.5 使用 CPU offload(极限节省显存)

如果模型太大,可以考虑开启 CPU offload。在加载模型时查看文档,或者使用 accelerate 库,但需手动修改代码。对小白不太友好,这部分可跳至踩坑点。

五、小白易踩坑点全汇总(避坑必读)

5.1 NVIDIA 驱动与 CUDA 版本不匹配

最常见的报错:“CUDA driver version is insufficient for CUDA runtime version”。解决:用 nvidia-smi 查看右上角显示的 CUDA Version,确保这个版本不低于你安装的 CUDA Toolkit 版本。例如显示 CUDA 12.5,那么安装 CUDA 11.8 完全没问题;但如果驱动太老只支持 10.2,就需要更新显卡驱动。

5.2 PyTorch 安装的 CUDA 版本错误

安装 PyTorch 时必须选择带 +cu118 的版本,而不是默认的 CPU 版。可以在 Python 里执行 torch.version.cuda,如果返回的是 11.8 就对,返回 None 就是装成了 CPU 版。

5.3 模型下载中断或连接超时

国内的网络访问 ModelScope 源可能较慢。可以在代码前添加镜像环境变量:

set MODELSCOPE_CACHE=D:\modelscope_cache
set MODELSCOPE_ENVIRONMENT=PRODUCTION

如果仍然失败,可以直接去 模型主页 手动下载所有文件,放到缓存目录,注意目录结构要与自动下载的一致

5.4 显存不足(CUDA out of memory)

报错信息通常最后一段是 CUDA out of memory。解决优先级:

  1. 关闭其他占用显存的应用(浏览器、其他 Python 进程等)。
  2. 降低视频分辨率至 256x256。
  3. 减少帧数,比如 num_frames=16。
  4. 启用半精度(autocast)。
  5. 如果还不行,可以重启电脑释放全部显存。

5.5 生成的视频只有几帧或无法播放

可能是 ffmpeg 未正确安装。虽然安装了 imageio-ffmpeg,但部分模型可能硬编码调用系统 ffmpeg。请确保系统 PATH 中包含 ffmpeg 的 bin 目录。验证方法:在命令行输入 ffmpeg -version,有版本信息即正常。

5.6 激活虚拟环境后运行报错“No module named ‘modelscope’”

检查是否在激活该虚拟环境的状态下安装的包。解决办法:保证命令行前缀有 (t2v_env),然后执行 pip list 确认 modelscope 是否存在,不存在则重新 pip install modelscope

扩展推荐:Ollama 与 vLLM 本地推理工具

除了 ModelScope 的文本生成视频模型,如果你还想在本地运行大语言模型(LLM)进行对话、编程辅助或知识问答,下面两个工具是目前社区最热门的方案,同样可以在你的 Windows + NVIDIA 显卡环境上运行。

Ollama —— 小白友好的本地 LLM 运行器

Ollama 是目前最易用的本地大模型运行工具,提供一键安装、模型管理、命令行和 API 调用,支持 Llama 3、Qwen2、Gemma、Mistral 等数十种开源模型。Windows 版可前往 Ollama 下载页 下载安装包,双击即可完成安装。

安装后使用示例:

ollama run qwen2:7b

首次运行会自动下载模型(约 4GB),之后即可直接在命令行对话。Ollama 还会自动启动一个本地 HTTP 服务(默认端口 11434),可以通过 API 接入各类 AI 客户端(如 Chatbox、Open WebUI)。

优势总结:

  • 安装和上手极快,真正的一键运行
  • 内置模型库丰富,支持模型量化(如 q4_K_M 节省显存)
  • 自动处理显存分配,16GB 显存可流畅运行 7B~14B 模型
  • 社区生态成熟,第三方工具支持广泛

vLLM —— 高性能 LLM 推理引擎

vLLM 是一个面向生产环境的高吞吐量推理引擎,核心特性是 PagedAttention 技术,能够以极高的效率管理 KV 缓存,大幅提升并发请求的处理能力。它兼容 OpenAI API 格式,部署后可无缝对接各类应用。

注意事项:vLLM 主要面向 Linux 环境,在 Windows 上需要通过 WSL2 运行。如果你的系统未安装 WSL2,可先在 PowerShell(管理员)中执行:

wsl --install

然后在 WSL2 的 Linux 环境中安装 vLLM:

pip install vllm

python -m vllm.entrypoints.openai.api_server \
    --model Qwen/Qwen2-7B-Instruct \
    --host 0.0.0.0 \
    --port 8000

启动后即可通过 http://localhost:8000/v1 访问兼容 OpenAI 的 API。

优势总结:

  • 高并发吞吐,适合作为后端推理服务
  • PagedAttention 技术显著节省显存
  • 原生支持连续批处理(Continuous Batching)
  • 兼容 OpenAI API,可接入 LangChain、Dify 等框架

Ollama vs vLLM 对比

对比维度 Ollama vLLM
上手难度 极低,安装即用 中等,需要 WSL2/Linux
适用场景 个人学习、本地对话、API 调试 生产部署、高并发推理服务
显存效率 较好(支持量化模型) 优秀(PagedAttention)
API 兼容 自有格式 + OpenAI 兼容 OpenAI 格式完全兼容
并发能力 单请求为主 高并发连续批处理
Windows 支持 原生支持 需通过 WSL2

选择建议:如果你是刚入门,想快速体验本地大模型对话,优先选 Ollama;如果你有 Linux 环境(或 WSL2),并且需要搭建一个供团队或应用调用的高性能推理 API,推荐 vLLM。两者都是完全开源的项目,可以放心使用。

七、全文总结

至此,你已经在自己的 Windows 电脑上成功跑起了文本生成视频模型。回顾关键步骤:装好 Python、CUDA/cuDNN,创建虚拟环境,安装 PyTorch + ModelScope,下载模型并运行,根据实际效果调整分辨率和帧数。希望这篇教程能帮你顺利入门大模型本地实战!

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐