ARVICA / 文档中心
运行 vLLM 推理服务
使用小模型进行连通性测试 包含本机访问、健康检查与清理步骤
1. 准备兼容主机
先完成 GPU 环境检查 选择适配架构和驱动的 vLLM 正式镜像并设置 ARVICA_VLLM_IMAGE 记录镜像摘要以便复现 此小模型示例用于连通性测试 不是生产基准或 Arvica 预装模板
2. 启动并检查
在 GPU 主机运行 服务仅绑定本机地址 等模型加载完成后再检查 /health 应返回 HTTP 200 /v1/models 应列出所选模型 下载模型需要外网访问和足够磁盘空间
#!/usr/bin/env bash
set -euo pipefail
: "${ARVICA_VLLM_IMAGE:?Set a tested vllm/vllm-openai image tag or digest}"
nvidia-smi >/dev/null
docker run -d --name arvica-vllm --gpus all --shm-size=8g \
-p 127.0.0.1:8000:8000 -v arvica-hf-cache:/root/.cache/huggingface \
"$ARVICA_VLLM_IMAGE" --model Qwen/Qwen2.5-0.5B-Instruct \
--max-model-len 2048 --gpu-memory-utilization 0.8
# Model download and warm-up can take several minutes.
docker logs --tail 80 arvica-vllm
curl --fail http://127.0.0.1:8000/health
curl --fail http://127.0.0.1:8000/v1/models
3. 通过 SSH 隧道访问
在你的电脑运行并保持 SSH 会话 然后由客户端访问 localhost:8000 生产公网访问应另配身份认证与 TLS
ssh -i ~/.ssh/arvica_ed25519 -N -L 8000:127.0.0.1:8000 ubuntu@INSTANCE_IP4. 排查与停止
显存不足时减少上下文或并发并检查其他 GPU 进程 架构报错需换用兼容镜像 预热时拒绝连接先查看日志 使用 docker stop arvica-vllm 停止示例容器 再用 docker rm arvica-vllm 删除容器 模型缓存卷仍保留 停止容器不会停止云实例计费