作者 | 张建imest
来源 | 至顶AI实验室
深夜11点,浏览器里开着三个标签页:一张Claude账单,一张GPT-4账单,还有一张信用卡对账单。Kai盯着屏幕,突然意识到自己这个月花在AI token上的钱,比买菜还多。那一刻,他决定不再为每一个token付费,不再看着用量表在每次让AI重构一个函数时往上跳。他要跑自己的本地大模型。
如果这个场景看起来眼熟,说明这篇文章现在对你有用。本文整理自YouTube频道一位叫Kai的博主,在前几天刚发布的视频。视频主题是2026年如何为本地部署大模型选购硬件,覆盖Mac Studio M4 Max、NVIDIA RTX 5090、AMD Strix Halo与云端GPU租赁四条路径。
把时间拨回到本地大模型这件事本身,会发现这个决定的时机比想象中更准。就在Kai录这期视频前,Qwen团队于2026年开源了Qwen3-Coder-Next,一款基于Qwen3-Next-80B-A3B架构、总参数80B但每次仅激活3B的混合专家模型,官方数据显示它在SWE-Bench-Pro上的表现能追平参数量大它十到二十倍的模型。而就在视频发布前四天,Qwen团队又推出了总参数2.4万亿的Qwen3.8-2.4T-A95B。开源模型的更新节奏之快,恰好印证了视频里的核心判断:本地部署这件事,在2026年第一次真正具备了可行性。
AI编程工具的使用成本正在变成不少开发者每月账单上一笔不小的支出,"要不要自己买硬件"因此从极客话题变成了现实选择题。而Kai接下来要讲的,是他为了搞清楚这个问题,亲自踩过的每一个坑。
一台笔记本,装下曾经需要四张H100的模型
一年前,这期视频大概率不会被制作出来。如果想要一个真正能干活的本地模型,好到可以重构一个真实代码库、写测试、调试集成故障,那意味着你需要四张H100——数据中心级别的硬件,自带电费账单,不是随便塞在桌子底下的东西。
转折发生在2026年,两件事同时改变了局面。 第一是Qwen3-Coder-Next,800亿参数的混合专家模型,在Q4量化下体积压缩到46GB,视频里给出的判断是,这个模型在编程基准测试上的速度和准确度能匹配Claude Sonnet,而且第一次可以在自己拥有的机器上运行。第二是Qwen3.6 27B,一个270亿参数的稠密模型,在真实编程任务上的得分反而超过了体积更大的混合专家模型,体积压到16GB,在M5芯片上跑出超过25 tokens/秒的速度。
但视频也没有回避一个现实:本地推理在复杂的多步推理任务上并不能击败前沿模型,本地模型在SWE-Bench上大约落后Sonnet 4.6两分。买本地硬件的目的从来不是赢下每一场战斗,而是把日常工作里80%的部分——自动补全、重构、样板代码、代码审查——从账单里摘出去。
同一张卡,同一个模型,速度差了六到七倍
大多数教程会告诉你先装vLLM。它是生产级的服务框架,有一个体面的仪表盘,看起来专业又正经。Kai照着教程做了,把一个20GB的模型塞进24GB显存的显卡里开始跑分,结果是19 tokens/秒。他以为是配置没调好,于是花了几周时间试不同的量化方案,半夜刷GitHub issue,像个执着的调参侠。
直到某一天,他随手用llama.cpp跑了同一个模型、同一张卡。结果是120 tokens/秒。他盯着终端看了整整30秒。
这背后的技术原因值得说清楚,因为它决定了你该选哪套推理框架。vLLM是为数据中心设计的,为了同时处理大量并发请求,它依赖CUDA graphs——预先编译好的执行路径,省掉CPU和GPU之间来回沟通的开销。但CUDA graphs的编译需要一整块连续的显存。当一个20多GB的模型被塞进24GB的卡,再加上负责记住对话上下文的KV缓存,剩下的空间几乎不够用。CUDA graphs悄悄编译失败,系统退回到逐条指令由CPU单独调度的低效模式。
修复这个问题的不是某个配置参数,而是意识到自己在这一档硬件上用错了工具。 规则很简单:一张或两张消费级显卡,用llama.cpp;vLLM的优势只有在48GB以上的工作站显卡或显存充裕的云实例上才会真正打开。这个道理,Kai本可以一个下午就弄明白,结果花了几周。
一台安静的机器,也能装下Qwen3的主力模型
Mac Studio M4 Max,128GB版本,价格在4000到5000美元之间。Kai坦言自己曾经是"独显或什么都不要"的信徒,觉得用Mac跑严肃的AI推理,就像开一台很贵的丰田凯美瑞去跑一级方程式——好看,昂贵,但不对味。他现在承认自己错了。
关键在于苹果的统一内存架构:CPU和GPU不是隔着PCIe总线互相抢资源的两个独立部件,而是共享同一块128GB物理内存。M4 Max的内存带宽达到每秒546GB,这个数字才是真正的胜负手——生成文本本质上是一个内存带宽问题,每生成一个token都要从内存里重新拉取一遍模型权重,带宽越快,输出越快,而546GB/秒目前是消费级市场里最高的。
实测下来,M4 Max跑700亿参数的稠密模型,Q4量化下能达到每秒15到28个token;128GB内存池装下Qwen3-Coder-Next之后还留有余量,够开256K的上下文窗口。Kai还注意到,苹果自家的MLX框架在长上下文推理上已经成熟到能和llama.cpp掰手腕,有时甚至更快。
还有一件任何跑分表都不会写出来的事:插上电,运行,它就是能用。 不用折腾Linux驱动,不用重新编译带CUDA支持的llama.cpp,风扇也不会响得像准备起飞的喷气机。至于上限,市面上关于M4 Ultra的说法众说纷纭、彼此矛盾,Kai的建议是不要为一颗传闻中的芯片做预算规划——128GB的M4 Max是目前唯一经过验证的天花板,适合预算充足、想要一台安静省心机器的独立开发者。如果你看到Linux报错就会冒冷汗,这就是你的硬件。
四张显卡的诱惑,和它带来的负收益
RTX 5090,32GB显存,价格约2000美元,纸面上是单卡的最优解。从4090的24GB跳到5090的32GB,多出来的显存足够在装下Qwen3-Coder-Next的Q4版本之余,还给CUDA graphs和KV缓存留出空间。理论上,5090是单人开发者每美元token数最高的选择。
但Kai提醒得很直接:截至他录制视频时,5090在Qwen3-Coder-Next 32K到64K上下文下的验证跑分几乎不存在。 规格表说它应该能行,网上流传的数字还没扛住严格验证,买之前最好自己实测,别信论坛热度。
真正的陷阱藏在四卡方案里。Kai曾经在纸面上算过账:四张3090,把模型拆分到每张卡上,攒一台属于自己的小型集群,听起来很酷,很极客。但实际情况是:一张卡,每秒70到72个token;两张卡,90到96;四张卡,88到97。从两张卡加到四张卡,几乎没有任何提升,有时候反而更慢。 原因是模型被拆分到多张消费级显卡上运行时,卡与卡之间通过PCIe总线同步数据所花的时间,比实际计算的时间还多。数据中心用NVLink这条专用高速桥解决了这个问题,而普通主板上没有这条桥。两张二手3090的价格在1400到1800美元之间,四张要三千多美元——多花的1200美元买到的是负收益。Kai没有亲自踩这个坑,但他听一个踩过坑的人讲述时,能听出对方声音里的沮丧。如果还是想做多卡方案,把消费级多卡集群的上限定在两张卡,除非你确实需要40万token以上的上下文长度,并把KV缓存分布到多张卡上。
参数表上很漂亮,实测里更微妙
AMD Strix Halo,可以在Framework桌面机等产品里买到,价格1099到1999美元,128GB内存只要1500美元左右,对比苹果四千美元以上的定价,纸面上AMD赢了。
问题出在内存带宽。 M4 Max是每秒546GB,Strix Halo是256GB。如果拿它跑700亿参数的稠密模型,带宽瓶颈会把速度压到每秒5个token左右——手动重构代码可能都比等它跑完更快。但换成混合专家模型,比如1220亿参数的MoE,Q4量化下能跑到接近每秒30个token。原因是混合专家模型每次只激活一小部分参数,内存控制器只需要读取那一小部分,带宽瓶颈被大幅缓解。如果打算买它,就把自己的用途限定在混合专家架构上,它会在这个价位段表现出色;拿它跑稠密模型,省下的每一分钱都会变成后悔。
不买硬件,也是一种硬件决策
Vast AI上租一张H100,现在大约每小时1.49美元;RunPod约1.99美元;Lambda Labs约2.99美元。这不是纸上谈兵,价格的地板确实降下来了。
Kai给自己算过一笔账:按每小时3美元、每月持续开机720小时计算,成本是每月2160美元,这是盈亏平衡线。如果你现在的API月度支出持续高于这个数字,买硬件通常能在三到十二个月内回本;低于这条线,租更划算。
没有人会在广告里告诉你云端GPU的冷启动延迟。Vast AI或RunPod上的社区档位实例,从下单到拉取模型权重再到启动完成,可能需要30秒到3分钟。这意味着你要么让实例一直保持热启动状态——这会把按需付费省下来的钱全部吃掉;要么为顶级供应商的常驻无服务器端点付费。没有免费的午餐。 但如果你的工作负载确实不规律,或者还没准备好投入硬件成本,租用仍然是完全理性的选择,只是租之前把账算明白。
按预算,这是Kai给出的答案
预算五千美元以内的独立开发者:如果想要一台安静、开箱即用、以后再也不用操心GPU驱动的机器,选Mac Studio M4 Max 128GB;如果想要单位美元下最多的token数,并且不介意管理一台Linux服务器,选一套三千五百美元左右的RTX 5090方案。两条路径都能舒服地跑起Qwen3-Coder-Next Q4和Qwen3.6 27B——目前最好的两个本地编程模型。
预算一万五千美元以内的三到五人团队:搭一台共享推理服务器,两张二手RTX 3090,含机箱和存储总价三千到四千美元,用llama.cpp给每张卡单独跑一个server实例。不要用vLLM,不要买四张卡,除非要解决40万token以上的上下文问题,否则跳过NVLink那个幻想。
如果当前API月支出低于两千美元,或者工作负载本身就很不规律,租用云端GPU仍是更合理的选择:Vast AI价格地板最低,RunPod稳定性更好,如果冷启动延迟会打断你的工作流,就付费给一线供应商。
本地能给你四样东西,但给不了第五样
本地部署能带来的,是长上下文下不设上限的token用量,是自有代码不出门的真实隐私,是离线可用,是可以基于自己代码库微调的自由度。它给不了的是前沿模型在复杂多步推理任务上的质量。
Qwen3-Coder-Next在SWE-Bench上拿到70.6分,Qwen3.6 27B拿到77.2分,这两个数字确实令人印象深刻,但在复杂长推理链条上,它们仍然落后Sonnet 4.6,也明显落后Opus。如果让一个本地模型从零架构一个微服务,写测试、调试集成故障,全程不需要你插手,它大概率会陷入循环、产生幻觉,或者比头部商业API更快地跑偏。
诚实的框架是:本地是云端API的补充,不是替代品。 把日常工作里80%的部分交给本地模型,剩下复杂的20%交给Opus,你依然能省下大量开支,也依然掌握着自己数据的控制权。