ARVICA / 文档中心
GPU 环境准备与 SSH
安装模型服务前 准备并检查 Linux GPU 主机
1. 前置条件
使用实例已确认的 IP、SSH 用户和公钥关联 按系统和 GPU 安装 Docker Engine 与 NVIDIA 驱动 再按官方指南安装 Container Toolkit 重启 Docker 会影响现有容器 请安排维护时段 这些脚本已检查语法 尚未在 Arvica GPU 上实测
2. 从电脑连接
替换地址、用户名与私钥路径 首次连接前核对主机指纹 私钥只保留在你的电脑
ssh -i ~/.ssh/arvica_ed25519 ubuntu@INSTANCE_IP3. 检查运行环境
将 ARVICA_CUDA_IMAGE 设为与驱动兼容的 NVIDIA CUDA 镜像版本 预期宿主机和容器都列出分配的 GPU 此检查确认设备可见 不代表模型性能
#!/usr/bin/env bash
set -euo pipefail
# Run on the confirmed Linux GPU instance, not your laptop.
uname -m
nvidia-smi
nvidia-smi --query-gpu=name,memory.total,driver_version --format=csv
docker version
# Set a CUDA image tag compatible with the installed driver.
: "${ARVICA_CUDA_IMAGE:?Set a compatible nvidia/cuda image tag}"
docker run --rm --gpus all "$ARVICA_CUDA_IMAGE" nvidia-smi
4. 排查故障
SSH 超时:检查实例状态、IP 与端口权限 权限拒绝:检查用户名及公钥 宿主机没有 nvidia-smi:检查驱动 宿主机正常而容器失败:检查 Toolkit、运行时及镜像兼容性 不要通过关闭主机密钥校验绕过指纹不一致