生产级 AI 推理 GPU 基础设施
围绕响应时间、并发和每次有效输出的成本,确定推理部署配置。
什么客户适合?
适合运行开放权重语言、视觉、语音或向量模型的 AI 应用团队、SaaS 公司和企业,尤其适合需要控制模型与部署配置的客户。
典型工作负载
- 大模型服务:助手、RAG 应用及结构化输出 API。
- 视觉与音频:图像处理、语音识别及批量推理。
- 搜索流水线:向量生成、重排序及文档处理。
推荐评估的 GPU
- L40S:适合在完整显存预算可满足的前提下,评估较小模型和视觉任务。
- A100 或 H100:比较较大模型或更高吞吐需求;权重、KV 缓存和并发需要更多显存时,评估 H200。
最终选型取决于软件、显存预算及 Pilot 结果;可用容量和完整配置以报价确认为准。
vLLM optimisation and tuning ↗从几张 GPU 开始?
先用 1 张 GPU 为代表性模型建立低并发基线。若模型无法容纳,评估 2–4 张 GPU 上的模型并行。测量峰值流量后再增加副本;服务副本与模型切分解决的是不同问题。
Pilot 如何进行?
界定范围:约定模型版本、精度、输入输出长度、峰值并发和响应时间目标。
批准方案:开通前确认配置、供应商、地点、存储、Pilot 预算和澳元报价;Pilot 仅按客户接受的报价收费。
测量结果:测试冷启动与预热请求、首 token 延迟、输出速度、错误、显存及每次合格结果的成本,再根据结果约定扩容计划。
提前约定范围、时长、验收标准及价格。Pilot 不代表免费试用。客户接受报价前不收费,开通前披露基础设施供应商。
如何申请报价?
提供模型仓库及版本、量化格式、预期请求量、上下文长度、并发、延迟目标、地区和租期。我们会评估可行配置并准备费用明细报价。
提交询价表单后,Arvica 会审核兼容性与容量,再提供澳元报价,由客户接受后安排开通。澳大利亚/亚太工作时间提供中英文协助。
申请 Pilot 报价 →