前两天我们翻过一笔账:「自己买个显卡跑大模型,就token自由了?」。结论是token自由一半是真的、一半是被显卡价格遮住的幻觉。这篇把那个结论做成一份能直接用的自查清单——三个问题定方向、一张显存对照表定硬件、一套混合模式配置让本地和云端各干各的活。动手前十分钟过一遍,大概率能避开「能跑但不能干活」的坑。
第一步:三个问题定方向
先别急着看显卡,先看自己的使用场景。三个问题出自风闻社区博主的本地实测帖和掘金的部署实战文,顺序是固定的,别搞反。
一问数据:这件事的素材敢不敢上传?
敢,用云端;不敢,才值得考虑本地。聊天记录、客户名单、没发表的稿子、公司内部文档——这些喂给云端要掂量三分的素材,本地模型照单全收。本地部署真正值钱的地方从来不是省钱,而是数据不出门的自由。
二问频次:你是每天几百次地用,还是偶尔尝鲜?
尝鲜就先用免费工具把手感练出来:spark1.cn 的在线工具箱和 AI写作台,零硬件成本,先弄清楚自己到底需要AI干什么。高频、持续地用,硬件投入才摊得薄。
三问预算:前两问都指向本地,再去看显卡价格。
并且记住一条铁律:留足显存余量,宁买大一档,不买刚够用。原因看下一节的对照表就明白了。
三问里只要有一问答出「云端」,这份清单到这里就可以合上了——API早就不贵,按凤凰网9月4日的价格测算,DeepSeek V4 Flash 折算下来1亿token只要6.4元(相关背景可读一张显卡跑起DeepSeek V4)。为了省钱去囤硬件,是为本不存在的账单提前付款。
第二步:显存对照表——「能跑」和「能干活」是两回事
先说清一个常识:本地跑模型占的显存 ≈ 量化后的模型文件 + 运行时的 KV Cache。主流方案是 Q4 量化(把模型压到4比特,显存大降、效果损失有限);KV Cache 则是对话上下文的「运行时记忆」,上下文越长吃得越凶。掘金那篇实战文算过账:8GB 显存理论上能跑 7B 模型,但上下文稍长,KV Cache 就把显存吃光,模型要么变慢要么「失忆」——效果打骨折。
| 显存档位 | 代表硬件(参考) | Q4 量化下能跑什么 | 实际体验 |
|---|---|---|---|
| 8GB | RTX 4060 / 3070 级 | 7B 级模型 | 能跑但打骨折:短上下文尚可,一长就变慢、「失忆」 |
| 12–16GB | RTX 4070 级 / 16GB 统一内存 Mac | 7B 宽裕,14B 紧凑 | 跨过「真能用」线,适合中等长度上下文 |
| 24GB | RTX 3090 / 4090 | 27B 级(Q4 约需 17–19GB) | 「能干活」分界线:实测 Qwen3.8-27B Q4 约 100 tokens/秒,整理一周聊天记录这类真实任务够用 |
| 32GB | RTX 5090(攒机单里 24399 元的新卡) | 27B–32B,长上下文有余量 | 与 24GB 同档模型,但余量更足,或选更高量化精度 |
| 48GB+ | 双卡主机 / 64GB+ 统一内存工作站 | 70B 级模型 | 本地天花板起步,成本已是工作站级 |
| 云端 API(对照) | 无需硬件 | 顶尖大模型 | 按 token 计费但已经很便宜:Flash 级 1 亿 token 约 6.4 元 |
看表的三个要点:
- **对着「实际体验」列选,别对着「能跑什么」列选。**要「能干活」而不是「跑过了」,直接从 24GB 档起步。三万预算和三千预算之间,差的不是数字,是两个世界。
- **宁买大一档,不买刚够用。**表里的显存需求是「模型文件」口径,刚够装下文件,就没给 KV Cache 留位置——这正是 8GB 档打骨折的原因。
- **别忽略 Mac 路线。**统一内存 Mac 同样在表里:24GB 统一内存的 Mac 一样能跑 27B Q4,攒机不是唯一入口(这条路线的账,6999元,苹果把「算力」卖给普通人算过)。
第三步:混合模式配置——本地管隐私,云端管智商
对大多数人,最优解不是二选一,而是分工:高频、涉及隐私的小任务放本地,低频、要顶尖智商的大任务调云端 API。落到表上:
| 维度 | 本地模型 | 云端 API |
|---|---|---|
| 数据隐私 | 素材不出门 | 上传前需掂量 |
| 单次成本 | 趋近于零(只有电费) | 按 token 计费,已很便宜 |
| 智能上限 | 7B–32B 级 | 顶尖大模型 |
| 适合任务 | 聊天记录整理、私人文档初稿、敏感材料改写、离线问答 | 复杂代码、长篇深度稿、高难度推理 |
落地四步:
- 装一个运行器:Ollama(命令行,装好后
ollama pull 模型名一条命令拉取即用)或 LM Studio(图形界面,点选下载即可对话),两者都免费,不需要写代码。 - 按显存表拉模型:从上面的对照表里选 Q4 量化版本;显存边缘就选小一档,别硬上。
- 云端 API 留着当「第二大脑」:只在大任务时调用。按前面的账,低频调用几乎无感——1亿token 6.4元,普通人一个月也用不完零头。
- 定一条路由规则:每次任务先过「一问数据」——素材不敢上传,走本地;敢上传,走云端;本地效果不满意且素材不敏感,切云端重做。用上一周,这条规则就成肌肉记忆了。
风闻那位博主的用法就是现成例子:本地跑 Qwen3.8-27B,读取自己一周约500个微信聊天,把「意念回复过、实际忘了办」的事捞成一张待办清单——这种「根本不敢让云端模型干」的活,正是本地该干的活。
一页纸自查清单
动手买硬件前,逐项打勾:
- 一问数据:我确实有「素材不敢上传」的明确任务
- 二问频次:我是高频日用,不是三分钟热度的尝鲜
- 三问预算:前两问都指向本地,我再看的显卡价格
- 显存对照:按表确认目标模型的档位,宁买大一档、不买刚够用
- 路线确认:接受「本地管隐私、云端管智商」的混合模式,不指望一张卡通吃
- 预演手感:先用免费工具练过,清楚自己到底要 AI 干什么
前三项里任何一项打不了勾,就先用云端和免费工具,硬件缓一缓。AI 这件事上,从容从来不来自最贵的设备,而来自算清楚的那笔账。
Q: 本地部署大模型需要多少显存?
看模型规模和量化精度:7B 级模型 Q4 量化后 8GB 显存能跑,但上下文一长就被 KV Cache 挤爆、效果打骨折;12–16GB 跨过「真能用」线;27B 级 Q4 约需 17–19GB 显存,24GB 档(RTX 3090/4090 或 24GB 统一内存 Mac)才是「能干活」的分界线;70B 级则要 48GB 以上显存或工作站级统一内存。原则是宁买大一档、不买刚够用,给 KV Cache 留余量。
Q: 混合模式是什么?本地和云端怎么分工?
高频、涉及隐私的小任务放本地跑(聊天记录整理、私人文档初稿、敏感材料改写、离线问答),低频、要顶尖智商的大任务调云端 API(复杂代码、长篇深度稿、高难度推理)。每次任务前先问「素材敢不敢上传」:不敢,走本地;敢,走云端;本地效果不满意且素材不敏感,再切云端重做。
Q: 买了显卡是不是就「token自由」了?
一半是,一半不是。是的一半:边际成本趋近于零,电和卡都是自己的,问一万次和问一次账单不变,数据还不出门。不是的一半:边际成本为零的前提是先付掉一次性投入(显卡从一万五到两万四不等),而且如果只是想便宜地聊天写文案,云端 API 已经很便宜——Flash 级模型1亿token约6.4元。本地部署真正的自由是隐私自由,不是账单自由。
Q: 本地部署需要会写代码吗?用什么软件?
不需要。主流两条路线都免费:Ollama 走命令行,安装后 ollama pull 模型名 一条命令即可拉取并运行;LM Studio 是图形界面,点选下载模型就能对话,适合完全没碰过命令行的用户。显存对照表选好档位后,软件这一层的门槛几乎为零。
💬 评论