今天科技圈有个讨论挺热闹:智谱开源的 GLM-5.3-Flash 有320B参数,性能号称对标 Claude Opus 4.8,价格只要后者的四十分之一。评论区吵得最凶的不是性能,而是一个很朴素的问题:这么大的模型,普通人真能自己跑起来吗?
结论先放这儿:跑不动,也不该跑。320B参数的模型,光参数就要占600多G内存,想本地跑得先组一台几十万的服务器。这说的不是钱不钱的问题,是根本没必要。
那普通人到底什么时候该本地部署大模型,什么时候乖乖用云端API?今天把这笔账算清楚。
先说清楚:你的电脑能跑多大的模型?
模型的参数量决定门槛。这里给个大概的参照(参数是近似值,实际还看量化方式和显存):
1B-7B 级别:16G内存的普通电脑就能跑,MacBook 都能带得动。适合翻译、润色、简单的文本分类。用 Ollama 这类工具,一条命令就能装好。
8B-14B 级别:需要一块8-16G显存的显卡,或者32G内存的Mac。日常问答、写代码够用了,这是"本地党"最舒服的甜点区。Qwen 的轻量版、DeepSeek 的小号模型都在这个区间。
32B-70B 级别:开始吃硬件了,一般要24G以上的显存(比如4090、M系列顶配)或者双卡。能跑,但推理速度会明显变慢。
100B 以上:基本告别个人电脑。今天的 GLM-5.3-Flash(320B)、DeepSeek V4-Flash-Vision(305B)、阿里 Qwen3.8-Max(2.4T)都是这个量级,官方推荐就是走云端API。阿里那个2.4T的Max版,新闻里原话是"基本告别本地自跑,大概率走云"。
什么时候该选本地部署
本地部署最核心的卖点只有一个:数据不出门。以下场景强烈建议本地:
第一,隐私敏感内容。合同、病历、公司财务报表、还没公开的论文,这些东西往云端API一传,等于交给别人保管。哪怕服务商承诺不存数据,你心里也不踏实。本地跑,数据从头到尾没离开过你的硬盘。
顺带说个真事:有朋友的公司明文规定核心数据禁止上传任何外部AI服务,因为供应商条款里白纸黑字写着“输入内容可能被用于改进模型”。这种场景下,本地部署不是选项,是合规要求。
第二,离线环境。飞机上、地铁隧道里、内网办公环境,没网的时候想要AI帮忙,只有本地模型能救你。
第三,高频低价值任务。批量给几千条文本做简单分类、提取关键词,这种活儿用API按量计费,积少成多也是钱。本地跑一次性的,电费忽略不计。
第四,纯粹想学习。想搞懂大模型怎么部署、怎么调参、量化是怎么回事,本地装一个7B模型折腾一晚上,收获比看十篇教程都大。我之前写过 DeepSeek 本地部署和 Ollama 的完整教程,照做就行。
什么时候乖乖用云端API
反过来说,下面这些情况别硬扛本地:
要最强能力。你要写复杂代码、做深度推理、跑多模态任务,本地7B模型和云端GPT-5.6、GLM-5.3这类旗舰模型的差距是代差级的。本地跑个7B模型写业务代码,出错率能让你怀疑人生。
要最新功能。云端模型两周迭代一次,今天还在用的版本下个月就淘汰了。本地部署追版本,每次都要重新下载几十G文件,追不起。
要省事。注册、充值、调API,五分钟搞定,不用管显卡驱动、CUDA版本、显存溢出这些破事。我见过太多人本地部署折腾三天,最后发现还是API香。
要处理长文档、大上下文。几百页PDF要总结,本地小模型的上下文窗口装不下。云端旗舰模型一两百K上下文起步,随便喂。
算一笔钱账
很多人以为本地免费,云端要花钱。账其实要分开算。
本地部署的隐性成本:一张能跑14B模型的显卡,二手也要三四千;整机功耗拉满,一年电费几百。如果你只是每天问几十个问题,这笔投入回本遥遥无期。
云端API的价格其实被低估了。国产模型已经卷到地板价:GLM 系列百万token输入大概8块钱,跑普通任务一个月花不了几十块。就算用最贵的GPT-5.6 API,百万token输入约30美元,日常个人使用也到不了这个量级。真正烧钱的是你拿API去跑大批量生产任务,那种场景才需要考虑是不是自己部署。
所以个人用户的实际开销排序往往是:云端API(每月几十块)< 本地部署(一次性硬件投入)< 大批量跑API(每月上千)。对号入座就行。
想本地跑?四步上手(以Ollama为例)
如果你确实想试试本地部署,现在工具已经很成熟了,Ollama是最省事的一个,我之前的教程里写过完整流程,这里给个极简版:
第一步,装Ollama。去官网下载对应系统的安装包,装完就自带命令行工具。
第二步,拉模型。执行 ollama pull 拉一个7B级别的小模型,比如 qwen3:7b。模型体积好几个G,第一次下载耐心等。
第三步,开始对话。ollama run 加上模型名,就能在终端里跟它聊天了。想用图形界面,装个 Open WebUI 或者 AnythingLLM,体验接近网页版ChatGPT。
第四步,进阶玩法。把文档丢进AnythingLLM做本地知识库,问它“我们部门的报销流程是什么”,它从你的文档里找答案。数据全程不出本机,这就是本地部署最典型的应用。
显卡一般就选7B量级的量化版(占显存小,质量损失可接受);显卡强可以试试14B。别一上来就挑战70B,显存不够会直接报错劝退。
我推荐的混合方案
成年人不做选择题。我现在的工作流是这样的:
本地装一个7B左右的模型(Ollama一键搞定),专门处理私人笔记、草稿润色、离线查资料这些不涉密也不求极致质量的活儿。
写代码、深度分析、重要文档,走云端旗舰模型。质量就是生产力,这时候抠API那点钱是捡芝麻丢西瓜。
数据敏感的活儿,本地跑小模型兜底。又想要大模型能力又不肯数据出门?那只能砸钱买高端显卡自己扛,属于少数人的玩法。
总结
一句话:本地部署图的是隐私和自由,云端API图的是能力和省心。别被"开源""免费"这些词带着走,先想清楚你的数据值多少钱、你的任务要什么水平的模型,答案自然就出来了。
至于那些几百B参数的巨无霸开源模型,看看就好。它们开源的意义在给企业提供选择,不是给个人电脑准备的。跑不动不是你的问题,是它们本来就没打算让你跑。