Skip to content

原文链接: https://mp.weixin.qq.com/s/bFGlNr6EnE8UFkWJmoCiIg

作者: 数码辣鸡

版权声明: 本文为原创技术分享,转载请注明出处。


概述

两张Tesla V100 32G,合起来64GB显存——足够跑绝大多数开源大模型的全量版本。退役V100在闲鱼大量流通,价格远低于同等显存的在售新卡。Reddit上有玩家晒出双V100塞进联想P920工作站的方案。但V100是数据中心级的被动散热卡,没有自带风扇——你不给它想办法散热,几分钟就过温降频。

这篇讲两条路线:一条省钱(扩展柜),一条省心(工作站),以及社区里实际跑过的人怎么说。

为什么是V100

Tesla V100 32G是NVIDIA在2017-2018年发布的数据中心GPU,现在大批从云厂商退役流入二手市场。它对本地AI玩家的吸引力是三样东西:

① 32GB HBM2显存

单卡就是32G,两张就是64G。对比一下:RTX 3090是24G,4090是24G,5090是32G。两张V100加起来的显存比一张5090还多一倍。

② 900GB/s带宽

HBM2的带宽远超GDDR6。虽然V100的计算单元比现代卡弱(没有第四代Tensor Core),但大模型推理的瓶颈主要在带宽,不在算力。

③ 价格

作为退役卡,V100 32G的闲鱼价格远低于任何在售的大显存消费卡。作为退役卡,V100 32G在闲鱼的价格视成色和接口版本(PCIe vs SXM2)差异较大,但总体远低于任何在售大显存消费卡。

被动散热是唯一的坎

V100没有风扇。它设计为装在有强制风道的服务器机柜里,靠服务器自带的高速风扇吹过散热片。

如果你把它插在普通家用机箱里,没有定向气流吹过那个巨大的散热片,温度会在几分钟内飙到90°C以上触发降频保护。不是"发热大"的问题,是"完全不散热"的问题。

解决方案分两条路。

路线一:GPU扩展柜(省钱路线)

社区里有人展示过完整方案:从闲鱼淘一个退役的GPU扩展柜(原本配套服务器使用),内置强制风道和对应的电源接口,把V100直接插进去就能用。

优点:

  • 价格相对便宜(退役扩展柜+双卡,总价视来源和成色而定)
  • 散热不用自己折腾(柜子自带强制风道)
  • 独立供电,不占主机内部空间

缺点:

  • 噪音大(服务器级风扇,据使用者描述不适合放卧室)
  • 需要通过PCIe延长线或NVLink桥连接主机
  • 扩展柜型号不通用,要找跟V100兼容的插槽和电源接口

路线二:工作站机箱(省心路线)

Reddit r/homelab社区有玩家分享了另一种思路:把V100塞进联想P920、HP Z8这类企业级工作站。

帖主的配置方向是:联想ThinkStation P920,双至强处理器,128GB内存,1400W电源。他的核心顾虑是:两张V100能不能物理塞进去,散热够不够。

社区里一位实际装过的用户回复:"去年在P920里装了两张P40,散热没我想的那么糟——只要侧板盖上,机箱内部风扇吹出的气流足够。卡装在间隔够大的插槽里就行。"

关键经验:

  • P920的1400W电源足够带两张V100(V100 PCIe版TDP 250W×2 = 500W,还有大量余量)
  • 电源线用联想原配的GPU供电线即可,不需要额外转接
  • 插槽间距是关键:两张卡之间要留足空间让气流通过
  • 侧板要盖上(形成风道),不是开放式散热

预算参考: 该帖主预算约2000-2500欧元(按当前汇率约合16400-20500元人民币),包含整台工作站(双至强+128G内存+1400W电源+V100)。这条路显然比扩展柜贵得多,但换来的是一台正经的工作站,安静且可以日常使用。

64G显存能干什么

两张V100凑出的64G显存,在本地AI的世界里是一个相当舒服的配置:

  • 70B参数模型的Q4量化版: 约40-45GB,一张卡塞不下但两张够
  • DeepSeek V3(671B MoE): 64GB仍装不下全部权重,需大量卸载到内存,实际速度个位数tok/s
  • 全量7B/13B模型 + 超长上下文窗口: 绰绰有余
  • 多模型同时加载: 一张卡挂一个模型做路由

不过要注意:V100是Volta架构,不支持FlashAttention 2等新优化,也没有FP8/INT4原生加速。在相同量化等级下,推理速度不如RTX 3090/4090。但显存容量的优势是实实在在的——能装得下的模型本地跑,总比装不下被迫付API钱好。

避坑清单

  1. 确认是32G版本: V100有16G和32G两个版本,价差明显。闲鱼上要看清楚

  2. PCIe vs SXM2接口: PCIe版本可以插普通主板/工作站;SXM2版本需要专用底板(更便宜但兼容性差很多)

  3. 不要买矿卡: V100主要用于数据中心训练,矿场用得少,但仍建议确认来源

  4. 驱动兼容: V100在最新CUDA上仍有支持,但部分新框架可能需要降版本

  5. 噪音预期: 无论扩展柜还是工作站,为被动卡提供足够风量都意味着风扇不会安静

如果让你在扩展柜方案和万元级工作站之间选,你选哪条路?还是干脆买张RTX 3090一步到位?

总结

双V100方案适合对显存有硬性需求、预算有限、且能接受一定噪音的玩家。核心在于解决被动散热问题——要么用服务器扩展柜,要么用企业级工作站。

对于大多数本地AI玩家,如果预算允许,RTX 3090/4090依然是更省心的选择。但对于需要64G+显存跑大模型的用户,退役V100是目前性价比最高的方案之一。


参考资料


本文由 AiTimes 智能时代 整理发布,版权归原作者所有。