本地大模型部署选型器
输入你的显存,看看能跑多大的模型、该选什么量化档,顺手把命令模板抄走。全部在你自己的浏览器里算,不发任何请求,也不代管模型下载。
选型结果
命令模板
装好运行器之后,模型名与量化标签以官方模型库实际条目为准——本站不提供模型下载,也不代跑任何命令。下面给的是通用形态,照着替换占位符即可。
显存档位对照表
「能跑」和「能干活」是两回事:刚够装下模型文件,就没给运行时的 KV Cache 留位置。下表为 Q4 量化口径的经验判断,选硬件时对着「实际体验」列选,别对着「能跑什么」列选。
| 显存 | 代表硬件(参考) | Q4 下能跑 | 实际体验 |
|---|---|---|---|
| 8GB | RTX 4060 / 3070 级 | 打骨折 | 能跑 7B 级,但上下文一长就变慢、「失忆」 |
| 12GB | RTX 4070 级 / 12GB 统一内存 Mac | 勉强能用 | 7B 宽裕,14B 紧凑 |
| 16GB | 16GB 显存卡 / 16GB 统一内存 Mac | 真能用 | 跨过「真能用」线,适合中等长度上下文 |
| 24GB | RTX 3090 / 4090 级 | 能干活 | 27B 级 Q4(约 17–19GB)可用,真实任务的分界线 |
| 32GB | RTX 5090 级 | 能干活·余量足 | 27B–32B,长上下文更有余量,或选更高量化精度 |
| 48GB+ | 双卡主机 / 64GB+ 统一内存工作站 | 本地天花板 | 70B 级起步,成本已是工作站级 |
| 云端 API(对照) | 无需硬件 | 顶尖大模型 | 按 token 计费但已经很便宜,Flash 级 1 亿 token 约 6.4 元 |
口径来源:站内《本地部署大模型自查清单》(显存对照表 + 混合模式配置)。本页只做交互化与命令生成,不重复论述。
常见问题
本地部署大模型需要多少显存?
按模型规模与量化精度算:7B 级 Q4 量化后 8GB 显存能跑,但上下文一长就被 KV Cache 挤爆;12–16GB 跨过「真能用」线;27B 级 Q4 约需 17–19GB,24GB 档才是「能干活」的分界;70B 级要 48GB 以上或工作站级统一内存。原则是宁买大一档、不买刚够用,给运行时留余量。
这个工具会上传我的信息吗?需要积分吗?
都不会。这是纯前端计算器:显存换算与命令生成全部在你自己的浏览器里完成,不发送任何请求、不消耗积分、也不需要注册。本站服务器不接触你的任何数据,更不代管模型下载。
本地部署需要会写代码吗?用什么软件?
不需要。主流两条路线都免费:Ollama 走命令行(装好后一条 pull 命令拉取即用),LM Studio 是图形界面,点选下载模型就能对话,适合完全没碰过命令行的用户。选好档位后,软件这一层的门槛几乎为零。
装好之后怎么用?
跑起来有两条路:一是在运行器自带的对话窗口里直接用;二是把本地服务当成一个「本地 API」(Ollama 默认监听本机 11434 端口),接进你习惯的客户端。隐私敏感的任务放本地,要顶尖能力的大任务仍旧调云端,分工使用最划算。
显存刚好卡在边界怎么办?
降一档最省心:要么换小一号的模型规模,要么把量化从 Q5/Q8 降到 Q4。也可以缩短上下文长度(KV Cache 是显存的隐形大户)。别指望「刚够装下模型文件」就能顺畅干活——那正是 8GB 档「打骨折」的原因。
到底该不该自建,还是直接用云端?
先过站内那篇《本地部署大模型自查清单》:一问数据敢不敢上传,二问是不是高频日用,三问预算。三问里只要有一问答出「云端」,就先用云端 API——按当前价格,Flash 级模型 1 亿 token 也就几块钱,为了省钱去囤硬件是为不存在的账单提前付款。本地真正值钱的是「数据不出门」。