高并发向量服务:我是如何搭建专属 Qwen3-Embedding 的
·

话不多说,直接上~
1,安装,环境搭建
1,这里建议使用Conda做环境配置,不会的看往期文章。
#验证Conda版本
conda --version
#没有就进行安装
centos8.4
#安装conda
yum install conda
#列出所有已创建的Conda环境
conda env list
#或
conda info --envs
#创建新的Python环境
conda create -n embedding python=3.12 -y
conda init bash
#激活环境
conda activate qwen3_embedding_8B
2,安装vllm
#安装vllm
pip install vllm
安装完成vllm后,下载需要的模型(这里参考一下vllm支持的模型,有些模型vllm不支持)
支持的模型列表:
https://docs.vllm.ai/en/latest/models/supported_models/?h=[#embedding](javascript:😉

3,下载模型
3.1 去魔塔社区:
https://www.modelscope.cn/models/Qwen/Qwen3-Embedding-4B

3.2 使用魔塔社区下载,先安装modelscope
pip install modelscope
3.3 下载模型
默认下载:
这种下载的路径会默认下载到:
/home/admin1/.cache/modelscope/hub/models/
modelscope
8
我们如果要下载到指定目录就使用(以下载README.md到当前路径下“dir”目录为例)
modelscope
4
4
2,使用
1,使用vllm启动,并进行curl调用
注意:Model loading took 7.5538 GiB memory,启动需要7.5538G内存噢,分配尽量8G以上
python3 -m vllm.entrypoints.openai.api_server \
--model /home/aidata/embedding/Qwen3-Embedding-4B \
--served-model-name Qwen3-Embedding-4B \
--tensor-parallel-size 1 \
--gpu-memory-utilization 0.19 \
--trust-remote-code \
--disable-log-requests \
--max-model-len 2028 \
--hf-overrides '{"is_matryoshka": true, "matryoshka_dimensions": [32, 64, 128, 256, 512, 768, 1024, 2048, 4096]}' \
--port 8021 &
进行调用
#curl 测试
curl http://127.0.0.1:8021/v1/embeddings \
-H "Content-Type: application/json" \
-H "dimensions: 1024" \
-d '{"input": ["人工智能是计算机科学的一个分支", "引力是使物体相互吸引的力"]}'
返回结果:

3,并发测试
3.1 参数准备
1,这里我使用 Jmeter 进行并发测试。分别测试100,500,1000的并发。

2,记得添加header

3,添加结果树和聚合报告

3.2 参数结果
1,100次请求

2,500次请求

3,1000次请求

欢迎关注,不错过每一篇能直接落地的技术教程。
更多推荐



所有评论(0)