70B 模型到底需要多少显存?别只看模型文件大小
模型权重能装下,只是第一步。上下文、并发和运行时开销,决定它能否稳定服务真实用户。
· Arvica Cloud · 分析与采购指南
先把最基本的一笔账算清
假设模型恰好有 700 亿个参数,每个权重占 2 字节,原始权重就是十进制 140 GB,约 130.4 GiB。若理想地按每个权重 4 bit 紧密存放,原始数据为 35 GB,约 32.6 GiB。这只是在算权重,不是推荐显卡容量。量化元数据、没有量化的张量及具体权重格式都会改变实际占用,不能因为某张卡的标称显存大于后一个数字,就判断它适合生产部署。
能启动,不等于能承受并发
vLLM 文档说明了 KV 缓存压力与调度设置对服务的影响,缓存不足可能导致请求被抢占并重新计算。[1] 我们建议在模型加载后,用真实业务中较繁忙的一组请求测试:长输入、生成输出、同时访问的用户都要包含,并为运行时分配单独留出预算。只成功回答一个短问题,并不能说明它能处理多个用户同时上传的长文档。
用一张小测试矩阵做决定
从自己的业务中选取较短和较长两档输入长度,各自测试低并发与预期峰值并发。固定模型版本、输出长度上限和精度,记录启动峰值显存、稳定运行显存、请求失败、首 token 延迟及生成速度。每次只调整一个设置再测试。这是一份建议测试方案,不是 Arvica 实测报告;上面的计算不能认证某个配置或速度。
询价时发这些信息,少走一轮弯路
提供模型仓库与版本、量化格式、最长输入、预计并发数以及响应时间目标。如果已经遇到显存不足,附上去除敏感信息的日志片段和软件版本。要求报价列明完整配置及试用验收条件,而不只是某个 GPU 名称。若采用量化,先比较业务任务的回答质量,再决定是否接受更低的显存占用。
资料来源
资料查阅日期:2026-09-11
把分析用于你的工作负载
继续阅读
8 张 GPU 为什么不一定快 8 倍?多卡训练采购怎么比 →