想在自己电脑上跑大模型,过去要折腾一堆环境、量化、依赖。Ollama 把这件事简化成了一行命令:ollama run qwen3,模型自动下载、加载、开聊。它是目前本地运行开源大模型最流行的工具之一。
Ollama 是什么
Ollama 是一个开源的本地大模型运行工具,跨 macOS、Windows、Linux。它做了三件事:
- 一键拉取模型:从模型库直接下载 Llama、Qwen、Gemma、DeepSeek、Mistral 等主流开源模型的量化版本。
- 本地推理:模型跑在你自己的机器上,数据不上传,完全离线可用。
- 提供本地 API:启动后暴露一个本地 HTTP 接口,兼容 OpenAI 风格调用,方便把本地模型接进各种应用和框架。
为什么用它
- 隐私:敏感数据、代码、文档在本地处理,不发给任何云服务。
- 零成本:没有 API 调用费,只消耗自己的算力。
- 离线:断网也能用,适合内网、保密环境。
- 可定制:通过 Modelfile 自定义系统提示、参数,甚至导入自己微调的 GGUF 权重。
现在也能跑云端模型
Ollama 已经不只是"本地"工具。它提供托管在美国、欧洲和新加坡的云端模型,用法和本地一致——把模型名换成云端那个就行,不用改代码或换 SDK,适合本机显存跑不动的大尺寸模型。官方说明云端不记录、不训练提示与回复,并要求托管方执行零数据保留。本地运行仍然免费不限量,云端按额度走付费档。
2026 年这一年产品本身也有两处明显变化:Apple Silicon 上换成 MLX 后端以利用统一内存,Mac 端解码速度明显提升(预览版要求 32GB 以上统一内存);桌面端加入了 Claude Desktop 网关支持,可以把本地模型接进 Claude 桌面应用。
谁适合用
- 注重隐私、不想把数据交给云端的个人和团队。
- 开发者做本地原型、测试不同开源模型、离线部署。
- 想低成本大量调用模型(如批处理)的场景。
使用建议
本地模型的效果取决于你的硬件:显存/内存越大,能跑的模型越大、越聪明。消费级设备通常适合跑中小尺寸模型(7B~14B 量级),追求接近顶级闭源模型的质量则需要较强的 GPU。Ollama 常与 Open WebUI、LangChain、各类桌面客户端搭配,作为它们的本地推理后端使用。
价格
Ollama 本体开源免费,在自己机器上跑模型不限量,唯一成本是本地算力。云端模型另算:2026 年 8 月 31 日起改为按 token 的透明计价,各档按月给一笔额度,用完可以按同样单价继续用,没有服务费,也取消了此前 5 小时 / 每周的用量窗口,额度不跨月累计。官网定价页(2026-09-06 查看)列出的档位是 Free(起步额度 + 部分模型,充值后解锁全部模型)、Pro 每月 20 美元或年付 200 美元(含 60 美元额度、可并发跑多个模型)、Max 每月 100 美元(含 300 美元额度、10 路并发)、Team 每月 500 美元(含 1000 美元共享额度、不限人数)、Enterprise 面议。具体以官网为准。
