图片

话不多说,直接上~

1,安装,环境搭建

1,这里建议使用Conda做环境配置,不会的看往期文章。

#验证Conda版本
conda --version

#没有就进行安装
centos8.4

#安装conda
yum install conda

#列出所有已创建的Conda环境
conda env list
#或
conda info --envs


#创建新的Python环境
conda create -n embedding python=3.12 -y 

conda init bash
#激活环境
conda activate qwen3_embedding_8B

2,安装vllm

#安装vllm
pip install vllm

安装完成vllm后,下载需要的模型(这里参考一下vllm支持的模型,有些模型vllm不支持)

支持的模型列表:

https://docs.vllm.ai/en/latest/models/supported_models/?h=[#embedding](javascript:😉

图片

3,下载模型

3.1 去魔塔社区:

https://www.modelscope.cn/models/Qwen/Qwen3-Embedding-4B

图片

3.2 使用魔塔社区下载,先安装modelscope

pip install modelscope

3.3 下载模型

默认下载:

这种下载的路径会默认下载到:

/home/admin1/.cache/modelscope/hub/models/

modelscope
8

我们如果要下载到指定目录就使用(以下载README.md到当前路径下“dir”目录为例)

modelscope
4
4

2,使用

1,使用vllm启动,并进行curl调用

注意:Model loading took 7.5538 GiB memory,启动需要7.5538G内存噢,分配尽量8G以上

python3 -m vllm.entrypoints.openai.api_server \
    --model /home/aidata/embedding/Qwen3-Embedding-4B \
    --served-model-name Qwen3-Embedding-4B \
    --tensor-parallel-size 1 \
    --gpu-memory-utilization 0.19 \
    --trust-remote-code \
    --disable-log-requests \
    --max-model-len 2028 \
    --hf-overrides '{"is_matryoshka": true, "matryoshka_dimensions": [32, 64, 128, 256, 512, 768, 1024, 2048, 4096]}' \
    --port 8021 &

进行调用

#curl 测试
curl http://127.0.0.1:8021/v1/embeddings \
-H "Content-Type: application/json" \
-H "dimensions: 1024" \
-d '{"input": ["人工智能是计算机科学的一个分支", "引力是使物体相互吸引的力"]}'

返回结果:

图片

3,并发测试

3.1 参数准备

1,这里我使用 Jmeter 进行并发测试。分别测试100,500,1000的并发。

图片

2,记得添加header

图片

3,添加结果树和聚合报告

图片

3.2 参数结果

1,100次请求

图片

2,500次请求

图片

3,1000次请求

图片

欢迎关注,不错过每一篇能直接落地的技术教程。

Logo

汇聚全球AI编程工具,助力开发者即刻编程。

更多推荐