ARVICA / 工作负载解决方案

模型训练与微调 GPU 算力

通过代表性训练 Pilot 测量显存和每步时间,再规划完整训练任务。

什么客户适合?

适合领域模型适配、视觉模型训练和较大规模分布式实验的机器学习团队、研究机构与企业。可以提供现有训练流水线,也可以说明所需的配置协助。

典型工作负载

  • 参数高效适配:包含评估环节的 LoRA 与 QLoRA 实验。
  • 监督训练:视觉、语言或多模态模型训练及数据集迭代。
  • 分布式任务:更大批量或模型、检查点保存及恢复测试。

推荐评估的 GPU

  • L40S:在精度支持与显存满足时评估较小微调任务。A100 或 H100:作为较大训练任务的候选。
  • H200:用于评估显存需求较高的任务。多卡训练需确认完整拓扑、CPU、存储与互联,而不只是 GPU 名称。

最终选型取决于软件、显存预算及 Pilot 结果;可用容量和完整配置以报价确认为准。

Hugging Face PEFT — LoRA

从几张 GPU 开始?

较小 LoRA 或训练可行性测试,在显存允许时从 1 张 GPU 开始。实测显存或耗时需要时评估 2–4 张;8 卡节点或多节点集群应在扩展效率验证后确定。全参数训练可能需要不同的起始配置。

Pilot 如何进行?

  1. 界定范围:固定模型、方法、序列长度、微批量大小、数据样本和评估指标。

  2. 确认方案:开通前确认框架与容器兼容性、供应商、数据地点、检查点存储、时长和澳元报价。

  3. 验证结果:测量峰值显存和每步时间,完成评估与检查点恢复,再估算完整任务费用;客户按新增或已约定的报价决定是否延长。

提前约定范围、时长、验收标准及价格。Pilot 不代表免费试用。客户接受报价前不收费,开通前披露基础设施供应商。

如何申请报价?

请提供基础模型、训练方法、数据规模、序列长度、步数或轮数、框架、已知卡数、地区和截止时间,并在表单中选择完整训练或微调用途。

提交询价表单后,Arvica 会审核兼容性与容量,再提供澳元报价,由客户接受后安排开通。澳大利亚/亚太工作时间提供中英文协助。

申请 Pilot 报价

其他解决方案

机器人与 Physical AI 算力方案

生产级 AI 推理 GPU 基础设施

面向计算机视觉、视频与 3D 工作负载的 GPU 云