WeKnora Linux Ubuntu24.04本地部署新手自用debug方法存档
RTX 2000 Ada Generation 16G显存
引用部分侵权请联系删除
-
weknora安装步骤
震惊!小白也能5步搭建私有大模型知识库,WeKnora保姆级教程,零代码打造专属AI助手,AI开发者必看! - 知乎
WeKnora保姆级教程:Windows/Mac/Linux三端Docker部署差异与避坑指南-CSDN博客
-
ollama.service丢失
Linux 启动ollama服务报错:Failed to restart ollama.service: Unit ollama.service not found. - wuch - 博客园
-
静态配置llama.cpp所有依赖:ollama 0.30以上不自带llama-server,需要手动下载编译,并且要保证所有版本都匹配,需要把编译完成的目录下面的llama-server复制到ollama的根目录下
彻底解决llama.cpp动态链接库版本不匹配:从编译到运行的全流程方案-CSDN博客
git clone https://github.com/ggerganov/llama.cpp.git
cd llama.cpp
mkdir build && cd build
cmake .. -DBUILD_SHARED_LIBS=OFF
make -j4
-
修改daemon.json镜像源不生效,清除缓存(每次重启终端都会出现timeout)
- 推理端token过载
ollama show --modelfile trinhnv1205/qwen35-9b:latest | sudo tee embedding.Modelfile
sudo nano embedding.Modelfile
添加两行参数:
num_ctx 32768
num_predict -1
运行
sudo ollama create trinhnv1205/qwen35-9b:latest-max-context -f embedding.Modelfile
然后在WeKnora前端回答生成使用模型处选择新模型;
-
运行后前端没有监听80,关闭服务后重启,80被占用,多是nginx,把weknora端口改成别的(90);
-
host.docker.internal被SSRF blocked,需要在.env文件中的SSRF_WHITELIST_EXTRA填入host.docker.internal;
-
WSL2: RuntimeError: UVA is not available原因及解决办法
在nvidia笔记本显卡上如何用vllm拉起qwen3-0.6b(含WSL2: RuntimeError: UVA is not available解决办法)-CSDN博客
export VLLM_WSL2_ENABLE_PIN_MEMORY=1
-
vllm等软件默认调用huggingface,连接失败,需要手动添加环境变量改成调用modelscope
export MINERU_MODEL_SOURCE=modelscope
export VLLM_USE_MODELSCOPE=true
- torch安装方法(vllm undefined symbol: ncclCommWindowDeregister)
pip install -U torch torchvision torchaudio
自动安装匹配cuda版本的torch,中途可能会中止,根据提示下载对应版本即可
- WeKnora调用本地部署rerank模型
16G显存对于rerank模型正常运行来说十分小,因此选择qwen3-reranker-0.6B,vllm部署
vllm serve Qwen3-Reranker-0.6B --host 0.0.0.0 --port 8012 --gpu-memory-utilization 0.5 --served-model-name reranker --trust-remote-code --tensor-parallel-size 1
中途报错error500,发现是fastapi版本过高,安装旧版本
pip install fastapi==0.136.3
更多推荐




所有评论(0)