本地部署大模型:数据不出电脑的 AI 工具与开放权重模型
整理 Ollama、LM Studio、Open WebUI、Dify 等本地运行与私有化部署工具,以及 Qwen、DeepSeek、GLM 等开放权重模型,说明硬件门槛、许可证和多机推理的边界。
2026 年 9 月,英伟达开源了把家里多台电脑连成推理池的 PAIR,Perplexity 开源了本地推理引擎 Lily,GLM-5.3-Flash 以 MIT 许可开放权重——在自己的机器上跑模型,已经从极客爱好变成隐私和成本上的现实选项。本地部署的好处是数据不出设备、按次调用不再计费;代价是能跑多大的模型取决于你的显存和内存。这个专题把工具按「运行时 → 界面 → 应用」分层,再列出可以下载的开放权重模型。
谁适合看这个专题?
推荐工具(共 8 款)
Ollama新
本地运行大模型的开源工具,一行命令拉取并跑 Llama、Qwen 等;也可按 token 调用其云端模型
LM Studio新
本地大模型桌面客户端,下载、管理、对话一站式,可开本地 API 服务;个人使用免费但不开源
Open WebUI新
自托管的本地模型 Web 界面,支持多用户与权限管理,常与 Ollama 搭配成团队内部的 ChatGPT
Dify新
开源 LLM 应用与 Agent 平台,工作流、RAG 知识库、模型管理和可观测性在一个界面里,社区版可私有化部署
Qwen新
阿里通义千问大模型,支持文本、代码与多模态;旗舰 Qwen3.8-Max 为 2.4T 参数稀疏 MoE、100 万 token 上下文,开源权重可自部署
DeepSeek
深度求索的大模型产品,V4-Pro 与 V4-Flash 原生 100 万 token 上下文,模型权重开源,网页版与 App 免费使用
智谱AI新
智谱旗下 Z.ai 国际平台与 BigModel 中国大陆开放平台,分别提供 AI 助手、Agent、GLM API 和 Coding Plan
OpenCode
MIT 协议的开源终端 AI 编程 Agent,可接 75+ 模型提供商,会话存本地 SQLite,另有桌面端与 IDE 扩展
本地部署怎么选
| 工具 / 模型 | 类型 | 上手门槛 | 是否开源 | 适合场景 |
|---|---|---|---|---|
| Ollama | 运行时 | 中(命令行) | 是 | 本机跑模型、给程序提供接口 |
| LM Studio | 桌面客户端 | 低 | 否(个人免费) | 先把模型跑起来看效果 |
| Open WebUI | Web 界面 | 中(需 Docker) | 是 | 团队在内网共用 |
| Dify | 应用平台 | 中 | 社区版开源 | 知识库问答、内部工作流 |
| Qwen / DeepSeek / GLM | 开放权重模型 | 取决于硬件 | 权重开放,许可各异 | 按许可证与显存选尺寸 |
常见问题
- Q:本地部署大模型需要什么配置?
- A:取决于模型大小和量化方式,没有统一答案:参数量较小的模型在普通笔记本上就能跑,大模型需要大显存或大内存。可以参考一个具体门槛:Perplexity 的 Windows 本地 Agent 要求至少 24GB 显存,Mac 上的混合计算要求至少 24GB 统一内存。建议先用 LM Studio 或 Ollama 试一个小模型,再按速度决定是否换模型或升级硬件。
- Q:Ollama 和 LM Studio 选哪个?
- A:习惯命令行、要给其他程序提供接口,选开源的 Ollama;想用图形界面点选下载和切换模型,选 LM Studio,它个人使用免费但闭源。两者都能在本机开 API 服务;要给团队共用,可以在 Ollama 前面接一个 Open WebUI。
- Q:家里有好几台电脑,能合起来跑更大的模型吗?
- A:目前的开源方案做不到合并显存。英伟达 2026 年 9 月发布的开源 PAIR(Personal AI Router,beta)能把多台装了 Ollama 或 LM Studio 的机器连成一个推理池,对外提供 Ollama 兼容和 OpenAI 兼容的接口,但它做的是请求调度——单台跑不动的模型,连起来也跑不动。
- Q:开放权重的模型可以商用吗?
- A:要看各自的许可证。GLM-5.3-Flash 采用 MIT,IFM 的 K2 Horizon 系列采用 Apache-2.0,这类宽松许可允许商用;也有模型使用自定义许可证限制用途或用户规模。部署前逐个核对模型卡上的许可条款。