🧮 纯前端计算器 · 不上传 · 不消耗积分

本地大模型部署选型器

输入你的显存,看看能跑多大的模型、该选什么量化档,顺手把命令模板抄走。全部在你自己的浏览器里算,不发任何请求,也不代管模型下载。

免费 无需注册 不上传 浏览器内计算 含显卡档位 对照表
GB(也可直接填自定义数值)

选型结果

命令模板

装好运行器之后,模型名与量化标签以官方模型库实际条目为准——本站不提供模型下载,也不代跑任何命令。下面给的是通用形态,照着替换占位符即可。

显存档位对照表

「能跑」和「能干活」是两回事:刚够装下模型文件,就没给运行时的 KV Cache 留位置。下表为 Q4 量化口径的经验判断,选硬件时对着「实际体验」列选,别对着「能跑什么」列选。

显存代表硬件(参考)Q4 下能跑实际体验
8GBRTX 4060 / 3070 级打骨折能跑 7B 级,但上下文一长就变慢、「失忆」
12GBRTX 4070 级 / 12GB 统一内存 Mac勉强能用7B 宽裕,14B 紧凑
16GB16GB 显存卡 / 16GB 统一内存 Mac真能用跨过「真能用」线,适合中等长度上下文
24GBRTX 3090 / 4090 级能干活27B 级 Q4(约 17–19GB)可用,真实任务的分界线
32GBRTX 5090 级能干活·余量足27B–32B,长上下文更有余量,或选更高量化精度
48GB+双卡主机 / 64GB+ 统一内存工作站本地天花板70B 级起步,成本已是工作站级
云端 API(对照)无需硬件顶尖大模型按 token 计费但已经很便宜,Flash 级 1 亿 token 约 6.4 元

口径来源:站内《本地部署大模型自查清单》(显存对照表 + 混合模式配置)。本页只做交互化与命令生成,不重复论述。

常见问题

本地部署大模型需要多少显存?

按模型规模与量化精度算:7B 级 Q4 量化后 8GB 显存能跑,但上下文一长就被 KV Cache 挤爆;12–16GB 跨过「真能用」线;27B 级 Q4 约需 17–19GB,24GB 档才是「能干活」的分界;70B 级要 48GB 以上或工作站级统一内存。原则是宁买大一档、不买刚够用,给运行时留余量。

这个工具会上传我的信息吗?需要积分吗?

都不会。这是纯前端计算器:显存换算与命令生成全部在你自己的浏览器里完成,不发送任何请求、不消耗积分、也不需要注册。本站服务器不接触你的任何数据,更不代管模型下载。

本地部署需要会写代码吗?用什么软件?

不需要。主流两条路线都免费:Ollama 走命令行(装好后一条 pull 命令拉取即用),LM Studio 是图形界面,点选下载模型就能对话,适合完全没碰过命令行的用户。选好档位后,软件这一层的门槛几乎为零。

装好之后怎么用?

跑起来有两条路:一是在运行器自带的对话窗口里直接用;二是把本地服务当成一个「本地 API」(Ollama 默认监听本机 11434 端口),接进你习惯的客户端。隐私敏感的任务放本地,要顶尖能力的大任务仍旧调云端,分工使用最划算。

显存刚好卡在边界怎么办?

降一档最省心:要么换小一号的模型规模,要么把量化从 Q5/Q8 降到 Q4。也可以缩短上下文长度(KV Cache 是显存的隐形大户)。别指望「刚够装下模型文件」就能顺畅干活——那正是 8GB 档「打骨折」的原因。

到底该不该自建,还是直接用云端?

先过站内那篇《本地部署大模型自查清单》:一问数据敢不敢上传,二问是不是高频日用,三问预算。三问里只要有一问答出「云端」,就先用云端 API——按当前价格,Flash 级模型 1 亿 token 也就几块钱,为了省钱去囤硬件是为不存在的账单提前付款。本地真正值钱的是「数据不出门」。

拿不准该不该自建?先过一遍那三个问题,再决定要不要掏钱买显卡。

读《本地部署大模型自查清单》 先去 AI 工具箱试试云端