LM Studio 是一个跑本地大模型的桌面客户端:下载模型、管理版本、直接对话,全部在一个图形界面里完成;还可以开启本地服务器模式,给自己的代码提供一个本机接口。
它在本地 AI 这套工具链里的位置
现在跑本地模型基本是三件事分开做:引擎(Ollama、llama.cpp、vLLM)、界面(Open WebUI、LM Studio)、应用(编辑器插件、脚本)。LM Studio 的特点是把引擎和界面打包成一个应用,装完就能用,不必先理解模型格式、量化档位和服务参数。
因此它最合适的用法是入门与试模型:想知道某个 7B、14B 在自己这台机器上跑起来是什么手感,用它最快。
上手三步
- 安装:从官网下载对应系统的安装包,macOS、Windows、Linux 都有。
- 下载模型:在应用里搜索模型直接下载。它的推理底层用的是 llama.cpp;在 Apple Silicon 的 Mac 上还能用苹果的 MLX 运行,运行时可以在应用里切换和更新(Mac 上的快捷键是 ⌘ Shift R)。
- 开始对话:加载模型后就能在聊天界面里用。第一次试可以先选体积小一些的量化版本,确认速度和显存占用再往上换。
给开发者用:本地接口
在应用的 Developer 标签里打开服务器开关,或者在终端运行 lms server start,LM Studio 就会在本机提供接口,默认地址是 http://localhost:1234/v1。按官方文档,可用的接口有几类:
- OpenAI 兼容接口:已有的 OpenAI 客户端把 base URL 改成本机地址就能用;它也实现了
/v1/responses,所以 Codex 这类工具可以接上本地模型。 - Anthropic 兼容接口,以及 LM Studio 自己的 REST 接口。
- 官方 SDK:
lmstudio-python与lmstudio-js。
本地服务一般不校验 API key,客户端要求必填时随便填一个值即可。遇到「连接被拒绝」,多半是服务器没打开。
它还能作为 MCP 客户端(0.3.17 版加入),把 MCP 服务接给本地模型使用。有些 MCP 服务能执行代码、读本地文件,只装来源可信的。
不开界面也能常驻
2026 年 1 月的 0.4.0 版加入了 llmster,这是一个不需要图形界面的守护进程,可以部署在服务器或云主机上;同一版本开始支持并行处理多个请求,默认同时处理 4 个。这意味着「选定模型后必须换 Ollama 才能常驻」不再是唯一选择,小团队的内部服务也可以直接用它。
授权:工作也能免费用,但不是开源
2025 年 7 月 8 日起,LM Studio 在工作中使用也不再需要单独的商业许可,官方博客的说法是团队可以直接用,不用填表或联系他们。此前它只对个人使用免费。另有付费的企业版,提供单点登录等功能。
但它仍是闭源软件。按其应用服务条款,授权范围限于个人和内部业务用途,不得再分发,也不能作为托管服务提供给第三方。如果你的合规要求包含「工具链可审计」,或者打算把它包装成对外服务,这一条要提前确认。
现实的限制
本地推理的天花板是硬件:显存和内存决定了能加载多大的模型、上下文能开多长。别把云端旗舰模型的体验预期直接套到本地 14B 上,它们解决的是不同的问题。模型文件动辄几个到几十个 GB,国内下载速度也取决于网络条件。
什么时候该换工具
- 需要多人共享一个聊天界面:加一层 Open WebUI。
- 需要工具链全部开源、可审计:换 Ollama 或直接用 llama.cpp。
- 需要生产级吞吐:走 vLLM 这类推理引擎。
