ARVICA / 工作负载解决方案

生产级 AI 推理 GPU 基础设施

围绕响应时间、并发和每次有效输出的成本,确定推理部署配置。

什么客户适合?

适合运行开放权重语言、视觉、语音或向量模型的 AI 应用团队、SaaS 公司和企业,尤其适合需要控制模型与部署配置的客户。

典型工作负载

  • 大模型服务:助手、RAG 应用及结构化输出 API。
  • 视觉与音频:图像处理、语音识别及批量推理。
  • 搜索流水线:向量生成、重排序及文档处理。

推荐评估的 GPU

  • L40S:适合在完整显存预算可满足的前提下,评估较小模型和视觉任务。
  • A100 或 H100:比较较大模型或更高吞吐需求;权重、KV 缓存和并发需要更多显存时,评估 H200。

最终选型取决于软件、显存预算及 Pilot 结果;可用容量和完整配置以报价确认为准。

vLLM optimisation and tuning

从几张 GPU 开始?

先用 1 张 GPU 为代表性模型建立低并发基线。若模型无法容纳,评估 2–4 张 GPU 上的模型并行。测量峰值流量后再增加副本;服务副本与模型切分解决的是不同问题。

Pilot 如何进行?

  1. 界定范围:约定模型版本、精度、输入输出长度、峰值并发和响应时间目标。

  2. 批准方案:开通前确认配置、供应商、地点、存储、Pilot 预算和澳元报价;Pilot 仅按客户接受的报价收费。

  3. 测量结果:测试冷启动与预热请求、首 token 延迟、输出速度、错误、显存及每次合格结果的成本,再根据结果约定扩容计划。

提前约定范围、时长、验收标准及价格。Pilot 不代表免费试用。客户接受报价前不收费,开通前披露基础设施供应商。

如何申请报价?

提供模型仓库及版本、量化格式、预期请求量、上下文长度、并发、延迟目标、地区和租期。我们会评估可行配置并准备费用明细报价。

提交询价表单后,Arvica 会审核兼容性与容量,再提供澳元报价,由客户接受后安排开通。澳大利亚/亚太工作时间提供中英文协助。

申请 Pilot 报价

其他解决方案

机器人与 Physical AI 算力方案

模型训练与微调 GPU 算力

面向计算机视觉、视频与 3D 工作负载的 GPU 云