WSL2 本地部署 Qwen 35B 大模型终极指南

本文档基于 Windows 11 + WSL2 Ubuntu + NVIDIA RTX 5060 Ti 16GB 环境实测闭坑编译。按照本指南操作,可实现本地流畅运行 35B 参数级别的通义千问最新 MoE 模型,支持纯文本聊天、图文理解及 OpenAI 兼容 API 服务。经过专属参数优化,生成速度可达 30+ tokens/s


硬件与软件前置要求

项目 推荐配置 备注说明
显卡 NVIDIA RTX 30系及以上 本文针对 16G 显存优化。若为 12G 显存,建议后续选择 IQ3_M 量化版本
CPU 6核 12线程及以上 演示环境使用 AMD Ryzen 7 9700X
内存 16GB 及以上 推荐 32GB 体验更佳
硬盘 至少 20GB 可用空间 模型及组件文件约占用 18GB 空间
系统 Win 11 (22H2+) / Win 10 (21H2+) Windows 端需安装最新 NVIDIA 驱动(WSL 内无需单独装显卡驱动

一、 安装 WSL2 与配置 Ubuntu 基础环境

1. 一键安装 Ubuntu

以管理员身份打开 Windows PowerShell,执行以下命令:

1
2
3
4
5
6
# 检查 WSL 版本,确保是 WSL2
wsl --version

# 安装 Ubuntu 最新版
wsl.exe --install Ubuntu

提示:安装过程中会提示您输入自定义的 Linux 用户名和密码。完成后建议重启一次电脑。

2. 验证 GPU 共享

打开刚刚装好的 Ubuntu 终端,执行:

1
2
nvidia-smi

如果能正确输出你的显卡型号(如 RTX 5060 Ti)和 CUDA 版本,说明 WSL2 已经成功共享了 Windows 的显卡驱动。

3. 换源与安装基础编译依赖

为了拒绝下载龟速,先切换为国内镜像源,然后安装编译所需的基础工具(此处已剔除重复的 huggingface 依赖):

1
2
3
4
5
6
# 切换国内高速源(按提示选择阿里云或腾讯云即可)
bash <(curl -sSL https://linuxmirrors.cn/main.sh)

# 更新并安装核心编译工具
sudo apt update && sudo apt install -y wget curl build-essential cmake git


二、 安装 WSL2 专用 CUDA Toolkit 13.3

1. 配置 NVIDIA 官方 WSL 仓库

1
2
3
4
5
6
7
8
9
# 设置仓库优先级,防止系统包冲突
wget https://developer.download.nvidia.com/compute/cuda/repos/wsl-ubuntu/x86_64/cuda-wsl-ubuntu.pin
sudo mv cuda-wsl-ubuntu.pin /etc/apt/preferences.d/cuda-repository-pin-600

# 下载并安装本地仓库密钥
wget https://developer.download.nvidia.com/compute/cuda/13.3.0/local_installers/cuda-repo-wsl-ubuntu-13-3-local_13.3.0-1_amd64.deb
sudo dpkg -i cuda-repo-wsl-ubuntu-13-3-local_13.3.0-1_amd64.deb
sudo cp /var/cuda-repo-wsl-ubuntu-13-3-local/cuda-*-keyring.gpg /usr/share/keyrings/

2. 安装 CUDA 并配置环境变量

1
2
3
4
5
6
7
8
9
# 刷新源并安装 CUDA 工具包
sudo apt-get update
sudo apt-get -y install cuda-toolkit-13-3

# 将 CUDA 路径永久写入环境变量
echo 'export PATH=/usr/local/cuda-13.3/bin:$PATH' >> ~/.bashrc
echo 'export LD_LIBRARY_PATH=/usr/local/cuda-13.3/lib64:$LD_LIBRARY_PATH' >> ~/.bashrc
source ~/.bashrc

验证安装:执行 nvcc -V,若输出包含 release 13.3 即代表 CUDA 部署成功。


三、 编译最新版 llama.cpp(开启 CUDA 加速)

llama.cpp 是目前本地运行大模型性能最好的轻量级推理框架。

1
2
3
4
5
6
7
8
9
10
# 克隆源码
git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp

# 执行 CMake 配置(开启 CUDA 硬件加速)
cmake -B build -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES="120" -DCMAKE_BUILD_TYPE=Release

# 开始多核编译
cmake --build build --config Release -j $(nproc)

配置全局全局变量

为了方便以后在任何目录下直接输入命令调用,建议将二进制工具路径加入系统环境:

1
2
3
echo 'export PATH="$HOME/llama.cpp/build/bin:$PATH"' >> ~/.bashrc
source ~/.bashrc


四、 独立环境下载 Qwen 35B 量化模型

我们选择 IQ4_NL 量化版本。它针对 llama.cpp 进行了深度优化,比传统的 Q4_K_M 格式能省下约 10% 的显存,同时几乎不损失模型智商,让 16G 显存吃得刚好。

1. 使用 pipx 安装最新官方下载工具

为了避免 Ubuntu 自带的组件版本过旧,我们使用 pipx 虚拟隔离环境来安装最新版的 huggingface_hub

1
2
3
4
# 安装 pipx
sudo apt update && sudo apt install -y pipx
pipx ensurepath

⚠️ 重要步骤:执行完上面两行命令后,请关闭当前终端,重新打开一个新的 Ubuntu 窗口,然后再执行下面的安装命令:

1
2
3
# 安装最新版 huggingface 下载客户端
pipx install huggingface_hub

2. 下载模型与视觉组件

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
# 创建统一的模型存放目录
mkdir -p ~/models/Qwen3.6-35B-A3B
cd ~/models/Qwen3.6-35B-A3B

# 下载主模型文件(约 18GB)
hf download \
HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive \
--include "Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ4_NL.gguf" \
--local-dir .

# 下载多模态视觉投影文件(用于图文理解)
hf download \
HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive \
--include "mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf" \
--local-dir .


五、 优化运行模型与 API 服务

这里为你精简掉了原文档中重复混乱的命令。你可以根据需要,选择在“终端直接聊天”或“启动 Web/API 服务”。

选项 A:纯文本交互式终端聊天(速度最快)

直接在 Linux 终端里进行高速度的对话:

1
2
3
4
5
6
7
8
9
10
11
12
13
llama-cli \
-m ~/models/Qwen3.6-35B-A3B/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ4_NL.gguf \
-c 16384 \
-ngl 999 \
-ncmoe 16 \
-t 12 \
--flash-attn on \
--mlock \
--no-mmap \
--temp 0.7 \
--top-k 40 \
--top-p 0.95

核心优化参数释义

  • -ngl 999:将所有大模型层完整扔进显存(16G 刚好完美容纳)。
  • -ncmoe 16:告诉框架这是个 16 专家的 MoE 架构,激发其最大性能。
  • --flash-attn on:开启闪烁注意力机制,大幅降低显存压力并提速。

选项 B:一键启动多模态(图文)API 服务(最推荐 ⭐)

这种方式不仅会为你提供一个精美的网页聊天室,还可以作为一个完全兼容 OpenAI 接口标准的后端服务,用来对接类似 Page Assist、Cherry Studio、AnythingLLM 等各类精美的前端软件。

1
2
3
4
5
6
7
8
9
10
11
12
13
llama-server \
-m ~/models/Qwen3.6-35B-A3B/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-IQ4_NL.gguf \
--mmproj ~/models/Qwen3.6-35B-A3B/mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf \
-c 16384 \
-ngl 999 \
-ncmoe 16 \
-t 12 \
--flash-attn on \
--mlock \
--no-mmap \
--host 0.0.0.0 \
--port 8080

服务启动后,你可以通过以下三种方式访问它:

  1. 自带 Web 界面:直接在 Windows 浏览器中输入 http://localhost:8080,即可进行文本/图片聊天、参数调优。
  2. OpenAI 兼容接口:API 地址为 http://localhost:8080/v1/chat/completions
  3. 局域网内其他设备访问:在终端通过 ip addr 查看 WSL 的内网 IP,其他设备输入 http://<WSL_IP>:8080 即可连通。

六、 常见问题快速排查

  • 显存溢出(OOM)或推理时突然卡死:RTX 5060 Ti 16G 虽能吃下该模型,但当上下文过长时容易探顶。如果遇到该问题,请将启动命令中的上下文窗口 -c 16384 缩小为 -c 8192
  • nvidia-smi 报错找不到显卡:请去 NVIDIA 官网将 Windows 端的显卡驱动更新到最新版。
  • 编译 llama.cpp 报错:大概率是系统没读到 CUDA 路径。请确保运行了 source ~/.bashrc,或者直接输入 nvcc -V 检查有没有版本输出。