炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:科技行者)
2023 年,英伟达一年卖出去的数据中心 GPU 超过 300 万块。这些芯片大部分会在三年后被拆下来,换上更新的型号。你可能会以为这些"退役"的芯片会被直接销毁或者堆在仓库吃灰,但事实是,它们流入了一个庞大又混乱的二手市场,价格低到让人怀疑人生。
一块 V100 显卡,2018 年刚上市的时候卖一万美元,现在批量采购只要 60 美元。跌幅超过 99%。
这不是打折,这是近乎清仓甩卖的价格。剑桥大学、牛津大学和一家叫 Quettaflop AI 的公司的研究者们看到这个价格后,做了一件挺"疯"的事:他们真金白银地把 128 块二手 V100 攒成了一台集群,连服务器主板、CPU、内存都是二手的,然后让这台"垃圾堆里捡出来的机器"跑了整整一年的 LLaMA 大模型推理服务。
这台机器有个自嘲式的名字,DumpsterCluster,翻译过来大概是"垃圾场集群"。听起来像玩笑,但背后是一篇正儿八经的研究论文,而且得出的结论比想象中复杂得多。
一块顶级 GPU 的价格,能买多少台"破铜烂铁"
先说个数字,让你对比一下这个反差有多大。
一台 8 卡 B200(英伟达最新一代旗舰 GPU)的服务器,市场价大约 60 万美元。而研究者搭建的这台 128 块 V100 的集群,2024 年建成时花了 3.2 万美元,到 2026 年 3 月,二手价格继续跳水,重新攒一台只需要 2.2 万美元。
也就是说,60 万美元能买将近 30 台这样的"破烂"集群。
**这不是简单的便宜,这是接近三十倍的价格鸿沟。**
为什么会有这么大的价差?答案藏在硬件的折旧规律里。研究者专门去 eBay 上扒了 V100 和 A100 显卡的历史成交价,然后用一个叫"拉伸指数衰减模型"的数学公式去拟合价格曲线。
拉伸指数衰减模型:一种描述价格随时间加速下跌的数学公式,公式里有个叫 β 的参数,如果 β 大于 1,说明价格不是匀速下跌,而是越往后跌得越快。
拟合结果显示,V100 的 β 值是 2.43,A100 是 4.66,两者都远大于 1。这意味着显卡贬值不是一条直线往下走的斜坡,而是一个先慢后快的悬崖。刚发布的头几年,价格降得还算温和,但过了某个临界点,价格就开始跳崖式下跌,直到跌到几十美元这种"白菜价"。
这背后的道理其实很朴素。硬件更新换代太快,三代前的芯片性能上被彻底甩开,市场上没人愿意为老古董出高价,供给又因为数据中心批量退役而暴增,价格自然崩掉。
便宜是有代价的:那些教科书没告诉你的二手硬件问题
便宜绝对不是没有代价的。这篇论文很诚实地把二手 GPU 的坑一个个摊开讲。
第一个问题是能耗。老一代芯片用的是更落后的制造工艺,V100 用的是台积电 12 纳米工艺,而现在的 H100 用的是台积电 4 纳米工艺。制程越先进,同样的计算任务耗的电越少。这就跟老式白炽灯泡和 LED 灯的区别差不多,亮度差不多,但电费账单完全不是一个量级。
**芯片制程*:** 芯片制造用的技术精度,纳米数越小,工艺越先进,晶体管密度越高,通常也意味着更省电。
第二个问题是显存带宽。V100 用的是 HBM2 显存,带宽 900 GB/s;H100 用的是更新的 HBM3,带宽高达 3350 GB/s,差了将近 4 倍。这决定了显卡从内存里读写数据的速度,对大模型推理这种数据搬运密集的任务影响巨大。
**HBM(高带宽内存)*:** 一种专门给 GPU 用的高速内存技术,负责在显卡内部快速传输数据,代际越新,带宽越大。
第三个问题,也是最容易被忽略的一个,是可靠性。二手显卡通常已经在数据中心里连续跑了三年左右,相当于人退休前的最后一班岗,难免有些"零件老化"。研究团队为此专门做了硬件"体检",术语叫 binning。
**硬件分选(binning)*:** 在正式部署前对二手设备做压力测试,把有问题或性能不达标的单元筛出去,只留下合格品。
经过这套筛选流程后,团队还额外多备了 10% 的冗余设备,以应对未来一年运行中可能出现的故障。这个数字不是拍脑袋定的,是参考了之前 GPU 长期可靠性研究里"5 年生存率约 90%"的数据推算出来的。
这就像开一个老年合唱团,你知道队伍里总会有人偶尔嗓子不舒服请假,所以提前多招了几个替补,排练照常进行,观众根本感觉不到差异。如果不做这个预案,某天关键的一场演出突然有人掉链子,那才是真正的麻烦。
老 GPU 的软肋,和一套专门为它设计的"接力赛"打法
如果你直接把大模型塞进一块 V100,会立刻撞上一个硬墙:V100 只有 16GB 显存,而 LLaMA-70B 这种 700 亿参数的大模型,光是把权重塞进去就得占用远超这个容量的空间。换句话说,单块 V100 想跑起 70B 模型,根本无从下手,模型都装不进去。
这就是为什么这篇论文的核心突破不在硬件本身,而在软件调度策略上。
现有的主流大模型推理框架,比如业界广泛使用的 vLLM 和 SGLang,采用的策略叫张量并行优先。
**张量并行(TP)*:** 把模型的每一层横着切开,分给多块 GPU 同时算,算完之后各块 GPU 之间要互相"对账"(术语叫 scatter 和 gather),把结果拼起来再继续算下一层。
这套打法在新款 GPU 上很吃香,因为像 H100 这样的芯片,GPU 之间通信带宽本来就很高(900 GB/s),再加上它算力和显存带宽的比值也很大(H100 是 0.29 TFLOPs/GB),说明它本来就是"存储瓶颈型"设备,用张量并行去榨干显存带宽是个精明的选择。
但这个逻辑放到 V100 上就完全反过来了。V100 的显卡间通信带宽只有 300 GB/s,是 H100 的三分之一,而且它压根不是那种"显存严重拖后腿"的芯片(算力带宽比只有 0.13)。硬套张量并行,等于让一群本来腿脚就不太灵便的老将,非要频繁互相传球对账,反而拖慢了整体节奏。
于是研究者设计了一套完全不同的方案,叫设备级流水线并行。
**流水线并行(PP)*:** 把模型按层切开,不是横切而是竖切,每块 GPU 只负责几层网络,数据像接力赛一样从第一块 GPU 传到第二块,再传到第三块,一路传下去。
关键的创新点是,他们把流水线做得极其"深"。传统框架通常是每个服务器节点(一般是 4 到 8 块 GPU)作为一个流水线阶段,但这篇论文的方案是让每一块单独的 GPU 都变成流水线里的一个独立环节。为了塞进一个 LLaMA-70B 模型,他们硬是拆出了 80 个流水线阶段。
**这是目前已知比 vLLM 默认策略深得多的流水线设计。**
这套设计好在哪?因为只需要在层与层之间传递中间计算结果,不需要频繁地做张量并行那套"拆开又拼回去"的操作,每次跨设备传输的数据量压缩到了只有 3.125 GB/s,远远低于这批老显卡能承受的带宽上限。
这就跟工厂里的传送带装配线很像。如果每个工位都要跑去和隔壁工位反复确认零件安装角度(对应张量并行),那流水线速度会被通信卡得死死的。但如果每个工位只管接过传送带上的半成品,装好自己那部分零件,再放回传送带(对应流水线并行),那流水的效率反而更高,即便每个工位的手速(单卡算力)不算特别快。如果不这样设计,硬用张量并行硬凹在低通信带宽的 V100 集群上,通信延迟会把好不容易攒起来的算力全部吃掉。
不过深流水线也有代价:中间结果要一站一站往下传,如果每一步都靠 GPU 亲自去做数据搬运,GPU 就得停下手里的计算工作去"跑腿"。为了解决这个问题,研究团队又做了一个精巧的优化:让 CPU 负责所有的通信任务,GPU 只管埋头计算。
具体来说,当 GPU 在算第 t 个时间步的结果时,CPU 已经悄悄在后台把第 t+1 步需要的数据准备好了,等 GPU 算完直接就能接着往下算,不用停下来等数据。这个手法术语叫异步预取。
**异步预取*:** 提前在后台准备好下一步需要的数据,让计算和数据传输同时进行,互不阻塞。
这就好比一个厨师在炒菜的间隙,助理已经把下一道菜要用的食材切好摆在案头,厨师一转身就能接着炒,不用停下来自己去洗菜切菜。如果没有这个助理(也就是没有异步预取),厨师炒完一道菜后必须自己停火,跑去洗菜、切菜、备料,整个后厨的出餐速度会被硬生生拖慢一大截。
跑分说话:这些老古董到底能不能打
说了这么多设计思路,最终还是要看实测数据。
论文里用了三种典型的负载场景来测试:ShareGPT(模拟真实聊天对话)、Prefill-heavy(模拟长文本输入、短输出的场景,比如代码生成)、Decode-heavy(模拟短输入、长输出的场景,比如聊天机器人连续输出)。
对 80 亿参数的 LLaMA 3.1-8B 模型,在 Prefill-heavy 任务下,128 块 V100 拼起来的集群跑出了大约 22.4 万 tokens/秒,这个成绩甚至超过了单块最新款 B200(约 6.3 万 tokens/秒)。
不过在 ShareGPT 这种更接近真实场景的负载下,128 V100 的成绩是 2.15 万 tokens/秒,B200 单卡则是 4.4 万 tokens/秒,V100 集群略逊一筹。
到了 700 亿参数的 LLaMA 3.1-70B,情况变得更有意思。这个模型体量大到单块 V100 根本装不下,必须靠前面说的深度流水线才能跑起来。128 V100 在 Prefill-heavy 任务下跑出了约 1512 tokens/秒,相比之下,8 卡 B200 集群能跑到 3.7 万 tokens/秒,8 卡 H100 集群是约 2 万 tokens/秒。
绝对速度上 V100 差了一大截,但别忘了价格。128 块 V100 的硬件成本只要 7680 美元(只算 GPU 本身),而 8 卡 B200 是 60 万美元,价差 78 倍。
如果按每美元能换来多少 TPS(也就是性价比)来算,128 V100 跑 8B 模型的性价比达到 29.16 tokens/秒/美元,而 B200 单卡只有 0.84。差了三十多倍。
**这才是这篇论文真正想说的话:绝对性能拼不过,但花每一分钱能买到的算力,二手集群反而更划算。**
有个细节值得单独说一说:随着模型从 8B 变成 70B,V100 集群相对新硬件的性价比优势在缩小,而不是扩大。8B 模型下,中国电价环境中 128 V100 的三年总成本大约只有 H100 的六分之一;但到了 70B 模型,这个优势收窄到只是 H100 成本的 1.5 倍左右(也就是 67% 的成本效率)。原因是老硬件在处理更大模型时,每个 token 消耗的电量涨得更快,运营成本这块短板在大模型场景下被放得更明显。
便宜是真的,但电费和碳排放才是隐藏的账单
如果故事到这里结束,那这篇论文的结论会显得过于乐观。真正让这项研究变得深刻的地方,是它专门去算了另外两笔账:电费和碳排放。
研究者选了四个具有代表性的电力供应场景做对比:美国电网(约 20% 可再生能源占比)、中国电网(约 30% 可再生能源占比)、巴西电网(约 90% 可再生能源占比,主要来自水电)、以及理论上完全接入风电的中国场景(接近 100% 可再生能源)。
**碳强度*:** 每消耗一千瓦时电力所产生的二氧化碳排放量,单位是克 CO2 每千瓦时,数值越低说明这片电网越"绿色"。
结果发现,在这四种电力环境下,V100 集群跑 8B 模型的碳排放大约是新款 GPU 的 3.7 倍。听起来已经不算小,但到了 70B 模型,这个差距直接飙升到 41 倍左右。
**这个数字意味着什么?意味着同样生成一百万个 token,用二手 V100 集群跑大模型,排放出的碳可能是用最新款 GPU 的四十倍还多。**
为什么差距在大模型上会被放大这么多?因为大模型需要更多设备协同工作,跑得时间更长,而 V100 单位算力消耗的电量本身就比新芯片高得多,这个劣势会随着计算规模的扩大被成倍放大,不是简单的线性叠加。
这里有个特别值得琢磨的现象:即便是号称"100% 可再生能源"的理想场景,碳排放也不会归零。研究者算出,光是维护风电、水电这类可再生能源基础设施本身,每千瓦时也会产生大约 10 克的残余碳排放。绿色能源不是零碳能源,只是碳强度极低。
那二手硬件的碳账到底怎么算才公平?这篇论文提出了一个挺有意思的会计学思路,给出了两种视角。
第一种叫延续视角:把 V100 的整个生命周期看作从第一次部署延续到二手复用阶段,那么制造芯片时产生的碳排放(叫做embodied carbon,翻译过来是"内含碳"或"隐含碳")需要按照第二段生命周期重新摊销计算。
**内含碳(embodied carbon)*:** 芯片从原材料开采、晶圆制造到组装出厂整个过程中产生的碳排放,这部分排放是"一次性"的,跟设备用多久没关系,但可以在使用年限里分摊计算。
第二种叫零内含碳视角:假设这些 V100 本来是要被数据中心直接淘汰扔掉的,它们的内含碳早在第一轮服役期间就已经"还完账"了,二手复用相当于白捡的,不用再算新的制造成本。
这两种视角给出的碳排放数字是上限和下限,具体用哪个取决于你信仰哪种碳排放会计学派。但无论用哪种,结论都指向一件事:硬件复用能省下的碳,主要是省在了"不用再造一块新芯片"这件事上,而不是运营阶段。运营阶段的账,老硬件天生就吃亏。
这就好比开一辆老爷车。造车这件事本身消耗的资源早已发生,如果你不开它,它就成了一堆废铁,这部分成本白白浪费。但如果你继续开它,省下了造一辆新车的资源,可它百公里油耗可能是新能源车的好几倍。你到底算不算环保,取决于你算的是"造车的账"还是"开车的账"。这篇论文诚实地把两本账都摆出来了,没有回避这个矛盾。
一年跑下来,这台"破烂机器"到底靠不靠谱
聊了这么多理论和数据,最实在的问题是:这台机器真的能持续稳定运行吗?
研究团队记录了整整一年里 128 块 V100 集群发生的所有故障事件,一共 58 次。其中真正需要更换硬件的故障只有 8 次,占比 13.8%,包括 2 次网卡故障、1 次 GPU 故障、5 次 CPU 故障。剩下的 86.2%(50 次)都只是软件层面能解决的小问题,32 次 PCIE 重置,18 次软件层面的重启,重启一下服务或者节点就能解决,不需要真的换零件。
**换算成年化硬件故障率,大约是 6.25%。**
这个数字和研究团队一开始预留的 10% 冗余设备策略是吻合的,说明当初的预案打得挺准。更关键的信息是,绝大部分故障都能靠软件手段自动化解决,不需要人工去现场拆机换件,这大大降低了运维这台"破烂机器"的实际成本和难度。
写在后面
读到这篇论文最触动我的一点,是它没有回避一个研究者很容易回避的矛盾:便宜的硬件到底是真省钱还是假省钱。很多讨论硬件复用的文章往往只强调省了多少采购成本,却对运营阶段的能耗和碳排放语焉不详。这篇论文把两笔账都算清楚了,甚至给出了两种碳排放会计视角让读者自己判断,这种诚实度在工程论文里不算常见。
还有一个细节值得琢磨:论文里提到,如果二手 GPU 用于 LLM 推理这个思路真的火起来,需求一旦涌上来,价格必然会涨,现在测算出的经济优势可能就没那么明显了。**这几乎是一个自我实现的悖论:一篇论证某件事划算的论文,如果被广泛采信,反而会让这件事变得不那么划算。**这种对自身结论时效性的清醒认知,比很多论文里那种"我们的方法永远最优"的自信更让我信服。
另外一个没直接说透但值得追问的问题:这套流水线并行的思路,理论上能不能用在训练场景上?论文明确说不能,因为训练需要频繁的梯度同步,对通信带宽的要求远比推理苛刻。但如果未来出现某种梯度压缩或异步训练的技术突破,二手 GPU 集群能不能也啃下训练这块硬骨头?这个问题这篇论文没回答,但留下了一个挺诱人的想象空间。
Q&A
Q1:DumpsterCluster是什么?
A:DumpsterCluster是研究团队用128块二手英伟达V100 GPU(以及二手CPU、主板、内存)搭建的一台大模型推理服务器集群,建造成本约2.2万美元,持续运行了一年,用来验证退役硬件能否高效服务LLaMA大模型推理。
Q2:用二手V100显卡跑大模型比新款GPU更省钱吗?
A:在硬件采购成本上确实便宜很多,128块V100集群成本只要7680美元,而8卡B200要60万美元。但运营成本(电费和碳排放)上V100吃亏明显,尤其是70B大模型场景下,碳排放可能是新硬件的41倍,所以只有在电价低、电网清洁的地区部署才真正划算。
Q3:为什么二手GPU不适合用来训练大模型,只能做推理?
A:因为大模型训练需要频繁在多块GPU之间同步梯度,对GPU间通信带宽要求极高,而二手V100的通信带宽(300 GB/s)只有新款H100(900 GB/s)的三分之一,用来训练会严重拖慢速度,而且训练时硬件一旦故障容易导致检查点回滚,损失更大,所以这套方案主要面向推理这种对通信要求相对宽松的场景。