知乎上有人提了个很实在的问题:为了实现Token自由,自己买GPU值得吗?
这问题能冲上热榜,说明动这个念头的不止一个人。API账单月月扣,谁不想一次性买断"随便用"的权利?我把近一个月关于显卡行情、本地部署实测和算力利用率的公开报道翻出来放在一起看,发现答案比想象中更反直觉——先看三组事实。
第一组事实:API其实没你想的那么贵
按掘金上一篇价格盘点,主流大模型API大致分三个梯队:旗舰模型输入每百万Token约2到15美元;国产性价比梯队(DeepSeek、通义千问、豆包这类)输入每百万Token只要0.5到4元人民币,输出2到16元;轻量梯队更低到输入0.1到1元。
换算一下体感:一篇公众号文章连输入带输出撑死几万Token。也就是说,多数个人用户就算天天重度使用,月账单大概率停留在几十元的量级。国家数据局的数据也印证了需求在暴涨——中国日均Token调用量从2024年初的约1000亿飙到2026年3月的超过140万亿。但注意,这是全社会的总量,摊到个人头上,API依然是"水电费"级别的小钱。
第二组事实:买卡这条路,坑比你想的深
想"买断自由"的人,第一反应是入手一张旗舰游戏卡。但腾讯新闻9月底的报道显示,RTX 5090的建议零售价是1999美元,因为AI搭建者大量抢购,部分市场实际售价已经炒到5000美元以上。
贵还只是第一关。5090只有32GB显存,而本地部署的铁律是:你能跑什么模型,基本由显存决定。掘金那篇本地部署复盘给了分档——24GB到32GB这一档(4090、5090),跑Q4量化的32B模型很轻松,70B只能勉强够边;Llama 3.1 70B全精度要约140GB显存,Q4压缩后也还要40GB左右,单卡消费级根本装不下。换句话说,花五千美元买回来的"自由",天花板是一个比云端旗舰弱一个身位的量化模型。
中关村在线还记录了一个真实案例:有用户嫌双路5090不够用——一方面32GB显存跑长上下文捉襟见肘,另一方面住宅供电线路只有15安培上限,上1600瓦以上电源还得单独铺20安培电路——最后直接花1.3万美元(约合人民币9.2万元)换了96GB显存的RTX PRO 6000。这才是"Token自由"的真实价码。
第三组事实:连企业买了卡,都未必用得起来
钛媒体9月的产业观察里有个细节:一家中小企业采购了国产GPU卡部署内部知识库,硬件到货后团队折腾了整整两周,模型还是跑不起来。这批卡标称算力能达到国际主流产品的七八成,实际输出速度却只有理论值的一成左右。同一篇报道援引中国信通院等机构的调研:国内智算中心GPU平均利用率不足30%。
一边是Token需求指数级暴涨,一边是昂贵的卡在机房里空转。这说明"Token自由"从来不是买硬件就能兑现的承诺,它是个工程问题——模型适配、量化调优、运维散热,每一环都在悄悄涨价。Jon Peddie Research总裁乔恩·佩迪的评价很中肯:如果你跑的是能装进32GB显存的小模型、且不在意纠错功能,5090算廉价方案;但超出这个边界,它派不上用场。
那到底谁该买卡?
把三组事实合起来,结论其实清晰:
该买的人:数据敏感、必须私有化部署的企业;要做模型微调的研究者;日均调用量大到API账单确实超过硬件折旧的团队。
不该买的人:绝大多数个人用户。你的月API支出和五位数硬件之间,回本周期以年计,而这一年里模型还会更新两三代——你买断的不是自由,是一张快速贬值的门票。
更务实的路线是:先用免费和低价档把需求跑明白。我自己维护的 spark1.cn 上,/tools/ 里上百个AI工具可以直接免费体验,/toolchains 还能把多个工具串成流程——先零成本验证你到底消耗多少Token,再决定要不要为"自由"付硬件钱。顺序反了,钱就白花了。
评论