본 가이드는 WSL 환경에서 vLLM를 설치하고 모델을 추론하기 위한 전체 과정을 담고 있습니다. 순서대로 명령어를 실행해 주세요.

Component Version

vLLM: v0.16.1rc1 • Python: 3.11 • CUDA: 13.0 • PyTorch: 2.7


1. 시스템 기초 설정 및 Miniconda 설치

💡 WSL 기본 버전 설정 이 명령어는 Linux 터미널이 아닌 Windows PowerShell & CMD 에서 실행합니다.

wsl --set-default-version 2

# 완료시 WSL 접속
wsl

📌 Miniconda 설치 및 환경 구성 가상환경(vram)을 생성하고 Python 3.11을 세팅합니다.

# Miniconda 다운로드 및 설치
wget <https://repo.anaconda.com/miniconda/Miniconda3-latest-Linux-x86_64.sh>
bash Miniconda3-latest-Linux-x86_64.sh

# 환경변수 추가 및 적용 (경로는 본인 환경에 맞게 수정)
echo 'export PATH="/home/dev/miniconda3/envs/vram/bin:$PATH"' >> ~/.bashrc
source ~/.bashrc

# 가상환경 생성 및 활성화
conda create -n vram python=3.11 -y
conda activate vram

2. 빌드 도구 및 GCC / CUDA 설정

wget <https://developer.download.nvidia.com/compute/cuda/repos/wsl-ubuntu/x86_64/cuda-keyring_1.1-1_all.deb>
sudo dpkg -i cuda-keyring_1.1-1_all.deb
sudo apt-get update
sudo apt-get -y install cuda-toolkit-12-8

# 환경변수 등록 (.bashrc 하단 추가)
echo 'export PATH=/usr/local/cuda-12.8/bin:$PATH' >> ~/.bashrc
echo 'export LD_LIBRARY_PATH=/usr/local/cuda-12.8/lib64:$LD_LIBRARY_PATH' >> ~/.bashrc
echo 'export CUDA_HOME=/usr/local/cuda-12.8' >> ~/.bashrc

# 변경사항 적용
source ~/.bashrc

3. 패키지 및 빌드 도구 설치

JSON 데이터를 다루기 위한 jq와, 빠르고 가벼운 파이썬 패키지 매니저인 uv를 설치합니다.

# jq 설치
sudo apt install jq -y

# 파이썬 패키지 매니저 uv 설치
curl -LsSf <https://astral.sh/uv/install.sh> | sh

4. vLLM 설치