OllamaNew

本地运行大模型的开源工具,一行命令拉取并跑 Llama、Qwen 等;也可按 token 调用其云端模型

  • 热度
  • AI编程开发
  • 免费额度
Ollama缩略图
信息有误?反馈纠错

请选择问题类型,无需登录或留下联系方式。

工具速览

  • 免费部分本地运行免费且不限量;云端模型按额度计费
  • 开源是
价格

Ollama 本体开源免费,在自己机器上跑模型不限量、只花本地算力。云端模型另按额度计费:Free 档含起步额度与部分模型,Pro 每月 20 美元(年付 200 美元)含 60 美元额度,Max 每月 100 美元含 300 美元额度,Team 每月 500 美元含 1000 美元共享额度,Enterprise 面议。

价格随官方调整,请以官网为准

想在自己电脑上跑大模型,过去要折腾一堆环境、量化、依赖。Ollama 把这件事简化成了一行命令:ollama run qwen3,模型自动下载、加载、开聊。它是目前本地运行开源大模型最流行的工具之一。

Ollama 是什么

Ollama 是一个开源的本地大模型运行工具,跨 macOS、Windows、Linux。它做了三件事:

  • 一键拉取模型:从模型库直接下载 Llama、Qwen、Gemma、DeepSeek、Mistral 等主流开源模型的量化版本。
  • 本地推理:模型跑在你自己的机器上,数据不上传,完全离线可用。
  • 提供本地 API:启动后暴露一个本地 HTTP 接口,兼容 OpenAI 风格调用,方便把本地模型接进各种应用和框架。

为什么用它

  • 隐私:敏感数据、代码、文档在本地处理,不发给任何云服务。
  • 零成本:没有 API 调用费,只消耗自己的算力。
  • 离线:断网也能用,适合内网、保密环境。
  • 可定制:通过 Modelfile 自定义系统提示、参数,甚至导入自己微调的 GGUF 权重。

现在也能跑云端模型

Ollama 已经不只是"本地"工具。它提供托管在美国、欧洲和新加坡的云端模型,用法和本地一致——把模型名换成云端那个就行,不用改代码或换 SDK,适合本机显存跑不动的大尺寸模型。官方说明云端不记录、不训练提示与回复,并要求托管方执行零数据保留。本地运行仍然免费不限量,云端按额度走付费档。

2026 年这一年产品本身也有两处明显变化:Apple Silicon 上换成 MLX 后端以利用统一内存,Mac 端解码速度明显提升(预览版要求 32GB 以上统一内存);桌面端加入了 Claude Desktop 网关支持,可以把本地模型接进 Claude 桌面应用。

上手:几条常用命令

安装后在终端里:

ollama pull qwen3        # 下载模型
ollama run qwen3         # 下载(如需要)并开始对话
ollama list              # 查看已下载的模型
ollama ps                # 查看正在运行、占用内存的模型
ollama rm qwen3          # 删除不用的模型,释放磁盘

模型名可以在官网模型库里查,同一个模型通常有多个尺寸和量化版本,用冒号后的标签区分;先挑小尺寸确认速度,再往上换。

接进自己的代码:Ollama 在本机 http://localhost:11434 提供接口,并在 /v1 路径下兼容 OpenAI 格式。已有的 OpenAI SDK 把 base URL 改成 http://localhost:11434/v1、API key 随便填,就能调用本地模型。默认只监听本机,要让局域网里其他机器访问,需要自己改监听地址,并做好访问控制,别把接口裸露到公网。

谁适合用

  • 注重隐私、不想把数据交给云端的个人和团队。
  • 开发者做本地原型、测试不同开源模型、离线部署。
  • 想低成本大量调用模型(如批处理)的场景。

使用建议

本地模型的效果取决于你的硬件:显存/内存越大,能跑的模型越大、越聪明。消费级设备通常适合跑中小尺寸模型(7B~14B 量级),追求接近顶级闭源模型的质量则需要较强的 GPU。Ollama 常与 Open WebUI、LangChain、各类桌面客户端搭配,作为它们的本地推理后端使用。

和同类怎么选

  • 想要图形界面、点几下就能试模型:LM Studio。
  • 给团队配一个共享的聊天界面:在 Ollama 前面加一层 Open WebUI。
  • 生产环境、高并发吞吐:用 vLLM 这类专门的推理引擎。
  • 想知道本地跑哪个开源模型:可以从 Qwen、DeepSeek 这类中文能力强的模型开始试。

价格

Ollama 本体开源免费,在自己机器上跑模型不限量,唯一成本是本地算力。云端模型另算:2026 年 8 月 31 日起改为按 token 的透明计价,各档按月给一笔额度,用完可以按同样单价继续用,没有服务费,也取消了此前 5 小时 / 每周的用量窗口,额度不跨月累计。官网定价页(2026-09-06 查看)列出的档位是 Free(起步额度 + 部分模型,充值后解锁全部模型)、Pro 每月 20 美元或年付 200 美元(含 60 美元额度、可并发跑多个模型)、Max 每月 100 美元(含 300 美元额度、10 路并发)、Team 每月 500 美元(含 1000 美元共享额度、不限人数)、Enterprise 面议。具体以官网为准。