OllamaNew

本地运行大模型的开源工具,一行命令拉取并跑 Llama、Qwen 等;也可按 token 调用其云端模型

  • 热度
  • AI编程开发
  • 免费额度
Ollama 界面预览
信息有误?反馈纠错

仅提交本页地址和问题类型,进入编辑复核队列;无需账号或联系方式。

工具速览

  • 免费部分本地运行免费且不限量;云端模型按额度计费
  • 开源
价格

Ollama 本体开源免费,在自己机器上跑模型不限量、只花本地算力。云端模型另按额度计费:Free 档含起步额度与部分模型,Pro 每月 20 美元(年付 200 美元)含 60 美元额度,Max 每月 100 美元含 300 美元额度,Team 每月 500 美元含 1000 美元共享额度,Enterprise 面议。

价格随官方调整,请以官网为准

想在自己电脑上跑大模型,过去要折腾一堆环境、量化、依赖。Ollama 把这件事简化成了一行命令:ollama run qwen3,模型自动下载、加载、开聊。它是目前本地运行开源大模型最流行的工具之一。

Ollama 是什么

Ollama 是一个开源的本地大模型运行工具,跨 macOS、Windows、Linux。它做了三件事:

  • 一键拉取模型:从模型库直接下载 Llama、Qwen、Gemma、DeepSeek、Mistral 等主流开源模型的量化版本。
  • 本地推理:模型跑在你自己的机器上,数据不上传,完全离线可用。
  • 提供本地 API:启动后暴露一个本地 HTTP 接口,兼容 OpenAI 风格调用,方便把本地模型接进各种应用和框架。

为什么用它

  • 隐私:敏感数据、代码、文档在本地处理,不发给任何云服务。
  • 零成本:没有 API 调用费,只消耗自己的算力。
  • 离线:断网也能用,适合内网、保密环境。
  • 可定制:通过 Modelfile 自定义系统提示、参数,甚至导入自己微调的 GGUF 权重。

现在也能跑云端模型

Ollama 已经不只是"本地"工具。它提供托管在美国、欧洲和新加坡的云端模型,用法和本地一致——把模型名换成云端那个就行,不用改代码或换 SDK,适合本机显存跑不动的大尺寸模型。官方说明云端不记录、不训练提示与回复,并要求托管方执行零数据保留。本地运行仍然免费不限量,云端按额度走付费档。

2026 年这一年产品本身也有两处明显变化:Apple Silicon 上换成 MLX 后端以利用统一内存,Mac 端解码速度明显提升(预览版要求 32GB 以上统一内存);桌面端加入了 Claude Desktop 网关支持,可以把本地模型接进 Claude 桌面应用。

谁适合用

  • 注重隐私、不想把数据交给云端的个人和团队。
  • 开发者做本地原型、测试不同开源模型、离线部署。
  • 想低成本大量调用模型(如批处理)的场景。

使用建议

本地模型的效果取决于你的硬件:显存/内存越大,能跑的模型越大、越聪明。消费级设备通常适合跑中小尺寸模型(7B~14B 量级),追求接近顶级闭源模型的质量则需要较强的 GPU。Ollama 常与 Open WebUI、LangChain、各类桌面客户端搭配,作为它们的本地推理后端使用。

价格

Ollama 本体开源免费,在自己机器上跑模型不限量,唯一成本是本地算力。云端模型另算:2026 年 8 月 31 日起改为按 token 的透明计价,各档按月给一笔额度,用完可以按同样单价继续用,没有服务费,也取消了此前 5 小时 / 每周的用量窗口,额度不跨月累计。官网定价页(2026-09-06 查看)列出的档位是 Free(起步额度 + 部分模型,充值后解锁全部模型)、Pro 每月 20 美元或年付 200 美元(含 60 美元额度、可并发跑多个模型)、Max 每月 100 美元(含 300 美元额度、10 路并发)、Team 每月 500 美元(含 1000 美元共享额度、不限人数)、Enterprise 面议。具体以官网为准。