场景专题

本地部署大模型:数据不出电脑的 AI 工具与开放权重模型

整理 Ollama、LM Studio、Open WebUI、Dify 等本地运行与私有化部署工具,以及 Qwen、DeepSeek、GLM 等开放权重模型,说明硬件门槛、许可证和多机推理的边界。

编辑推荐语

2026 年 9 月,英伟达开源了把家里多台电脑连成推理池的 PAIR,Perplexity 开源了本地推理引擎 Lily,GLM-5.3-Flash 以 MIT 许可开放权重——在自己的机器上跑模型,已经从极客爱好变成隐私和成本上的现实选项。本地部署的好处是数据不出设备、按次调用不再计费;代价是能跑多大的模型取决于你的显存和内存。这个专题把工具按「运行时 → 界面 → 应用」分层,再列出可以下载的开放权重模型。

谁适合看这个专题?

处理合同、病历、财务等敏感数据、不能上云的人想省掉 API 调用费、高频使用模型的开发者要在内网给团队搭 AI 助手的 IT 管理员想动手了解大模型运行原理的学生和爱好者

推荐工具(共 8 款)

本地部署怎么选

工具 / 模型类型上手门槛是否开源适合场景
Ollama运行时中(命令行)本机跑模型、给程序提供接口
LM Studio桌面客户端否(个人免费)先把模型跑起来看效果
Open WebUIWeb 界面中(需 Docker)团队在内网共用
Dify应用平台社区版开源知识库问答、内部工作流
Qwen / DeepSeek / GLM开放权重模型取决于硬件权重开放,许可各异按许可证与显存选尺寸

常见问题

Q:本地部署大模型需要什么配置?
A:取决于模型大小和量化方式,没有统一答案:参数量较小的模型在普通笔记本上就能跑,大模型需要大显存或大内存。可以参考一个具体门槛:Perplexity 的 Windows 本地 Agent 要求至少 24GB 显存,Mac 上的混合计算要求至少 24GB 统一内存。建议先用 LM Studio 或 Ollama 试一个小模型,再按速度决定是否换模型或升级硬件。
Q:Ollama 和 LM Studio 选哪个?
A:习惯命令行、要给其他程序提供接口,选开源的 Ollama;想用图形界面点选下载和切换模型,选 LM Studio,它个人使用免费但闭源。两者都能在本机开 API 服务;要给团队共用,可以在 Ollama 前面接一个 Open WebUI。
Q:家里有好几台电脑,能合起来跑更大的模型吗?
A:目前的开源方案做不到合并显存。英伟达 2026 年 9 月发布的开源 PAIR(Personal AI Router,beta)能把多台装了 Ollama 或 LM Studio 的机器连成一个推理池,对外提供 Ollama 兼容和 OpenAI 兼容的接口,但它做的是请求调度——单台跑不动的模型,连起来也跑不动。
Q:开放权重的模型可以商用吗?
A:要看各自的许可证。GLM-5.3-Flash 采用 MIT,IFM 的 K2 Horizon 系列采用 Apache-2.0,这类宽松许可允许商用;也有模型使用自定义许可证限制用途或用户规模。部署前逐个核对模型卡上的许可条款。