ARVICA / 文档中心

文档 / 软件与任务

运行 vLLM 推理服务

使用小模型进行连通性测试 包含本机访问、健康检查与清理步骤

1. 准备兼容主机

先完成 GPU 环境检查 选择适配架构和驱动的 vLLM 正式镜像并设置 ARVICA_VLLM_IMAGE 记录镜像摘要以便复现 此小模型示例用于连通性测试 不是生产基准或 Arvica 预装模板

Official documentation / 官方文档

2. 启动并检查

在 GPU 主机运行 服务仅绑定本机地址 等模型加载完成后再检查 /health 应返回 HTTP 200 /v1/models 应列出所选模型 下载模型需要外网访问和足够磁盘空间

#!/usr/bin/env bash
set -euo pipefail
: "${ARVICA_VLLM_IMAGE:?Set a tested vllm/vllm-openai image tag or digest}"
nvidia-smi >/dev/null
docker run -d --name arvica-vllm --gpus all --shm-size=8g \
  -p 127.0.0.1:8000:8000 -v arvica-hf-cache:/root/.cache/huggingface \
  "$ARVICA_VLLM_IMAGE" --model Qwen/Qwen2.5-0.5B-Instruct \
  --max-model-len 2048 --gpu-memory-utilization 0.8
# Model download and warm-up can take several minutes.
docker logs --tail 80 arvica-vllm
curl --fail http://127.0.0.1:8000/health
curl --fail http://127.0.0.1:8000/v1/models

3. 通过 SSH 隧道访问

在你的电脑运行并保持 SSH 会话 然后由客户端访问 localhost:8000 生产公网访问应另配身份认证与 TLS

ssh -i ~/.ssh/arvica_ed25519 -N -L 8000:127.0.0.1:8000 ubuntu@INSTANCE_IP

4. 排查与停止

显存不足时减少上下文或并发并检查其他 GPU 进程 架构报错需换用兼容镜像 预热时拒绝连接先查看日志 使用 docker stop arvica-vllm 停止示例容器 再用 docker rm arvica-vllm 删除容器 模型缓存卷仍保留 停止容器不会停止云实例计费

GPU 环境检查