Ollama

本地 LLM 运行工具,支持 DeepSeek、Qwen、Llama 等主流模型一键部署,完全离线运行

📅 收录: 2026-07-23 🔄 更新: 2026-07-23

Ollama 快速入门

一句话卖点:一键在本地运行大模型,无需 GPU、无需 Docker、无需联网 —— AI 自由的第一步。

这是什么?适合谁?

Ollama 是 Jeffrey Morgan 等人 2023 年开源(2024-2026 快速迭代)的本地 LLM 运行工具,主仓库 ollama/ollama,GitHub 176K+ stars。底层用 llama.cpp,封装了模型下载、自动量化、跨平台安装、API 服务等所有脏活,提供 ollama run deepseek-v4 这样的极简命令,真正做到「几行命令把大模型跑起来」。

它解决的核心痛点:很多人想用大模型,但不想把数据上传到云端,或者想实验性地跑模型但不想装 CUDA、装 PyTorch、折腾驱动。Ollama 把这些步骤都封装了 —— 下载模型、自动量化、CPU/GPU 混合推理,你只需要选模型。

适合谁?三类人最受益:一是注重隐私的开发者,数据不出本机,适合处理敏感代码、合同、医疗数据;二是学生和独立研究者,用自己电脑跑开源模型做实验,零成本;三是需要本地推理的工程场景:离线知识库、本地 Agent、边缘设备、教育 / 医疗 / 金融等数据不能出本机的行业;四是AI 体验者,想白嫖大模型而不想注册 OpenAI / Claude 账号。

不适合:需要训练 / 微调模型的人(Ollama 只做推理,用 LlamaFactory、Unsloth、Axolotl);需要极致吞吐量的生产环境(此时应选 vLLM、TensorRT-LLM、ScaleLLM);纯云端应用开发者(直接用 OpenAI API)。

准备工作

  1. 设备:macOS(M 系列最优)、Linux 原生、Windows 需 WSL2 或 Windows 原生预览版;
  2. 硬件:7B 模型仅需 8GB RAM,70B 模型建议 32GB+ 内存(Apple Silicon M2/M3/M4 统一内存架构表现极佳);
  3. 安装:macOS / Windows 官网下载安装包双击即可;Linux 用 curl -fsSL https://ollama.com/install.sh | sh;
  4. 网络:首次下载模型需联网(模型文件通常 4-20GB),之后完全离线运行;
  5. 前置知识:会使用终端 / 命令行即可,无需 Python 或 ML 背景。

3 步快速上手

第 1 步:安装并启动

# macOS / Windows:官网 https://ollama.com 下载安装
# Linux:
curl -fsSL https://ollama.com/install.sh | sh

# 安装完成后 Ollama 自动作为后台服务运行
# 验证服务是否运行
ollama list

第 2 步:下载并运行第一个模型

# 下载 DeepSeek-V4-Flash(约 8GB,中文推理强)
ollama run deepseek-v4-flash

# 或下载 Qwen 3.7(中文能力强)
ollama run qwen3.7

# 或 Llama 3.3(英文为主)
ollama run llama3.3:70b-instruct-q4_K_M

# 首次运行会自动下载模型,之后直接进入对话
>>> 你好,请用中文回答

第 3 步:作为 API 服务调用

# Ollama 默认作为后台服务运行,API 端点在 :11434
# 完整 OpenAI 兼容 API
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.7",
    "messages": [{"role": "user", "content": "写一首关于春天的诗"}]
  }'

# Python(openai 库)
from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
resp = client.chat.completions.create(
    model="qwen3.7",
    messages=[{"role": "user", "content": "你好"}]
)
print(resp.choices[0].message.content)

初级用法

  • 模型列表:ollama list 查看本地已下载模型;ollama search <keyword> 搜 Ollama Hub 上的模型;
  • 拉取特定标签:ollama pull qwen3.7:14bollama pull qwen3.7:q4_K_M(量化版本);
  • 删除模型:ollama rm qwen3.7;
  • 查看模型信息:ollama show qwen3.7(看 Modelfile、参数、模板);
  • 复制模型:ollama cp qwen3.7 my-qwen(基于现有模型创建自定义版本);
  • 停止服务:Windows / macOS 直接退出应用;Linux systemctl stop ollama;
  • 手动启动:OLLAMA_HOST=0.0.0.0:11435 ollama serve(指定端口)。

高级玩法

  • Modelfile 自定义模型:创建 Modelfile,调整 PARAMETER temperature 0.7SYSTEM "你是一个 Python 助手"ADAPTER ./lora.gguf,然后 ollama create my-bot -f Modelfile —— 可创建专属 persona 机器人;
  • LoRA 适配器:用 Unsloth / LlamaFactory 微调的 LoRA,通过 ADAPTER 指令挂载到 Ollama 模型,无需转换格式;
  • 多模型并行:ollama serve 支持同时加载多个模型,但受限于内存(M2 Max 64G 可同时跑 13B + 7B 两个模型);
  • 接入现有应用:由于 API 兼容 OpenAI,只需把 base_url 改为 http://localhost:11434/v1,几乎所有 LLM 应用(AnythingLLM、Open WebUI、Dify、LangChain)都能接入;
  • Open WebUI(推荐搭配):用 docker run -d -p 3000:8080 ghcr.io/open-webui/open-webui 启动 Web UI,体验类似 ChatGPT 但完全本地;
  • RAG 集成:用 LlamaIndex / LangChain + Ollama embedding(nomic-embed-text)做本地 RAG,数据不出本机;
  • 生产化部署:用 systemd / launchd 守护进程、挂载网络磁盘做模型仓库、结合 Nginx 反向代理对外提供 API;
  • Dify / Coze 集成:在 Dify / Coze 里加 Ollama 作为模型源,即可在低代码平台用本地模型。

小技巧

  1. 国内用户用 ModelScope 加速下载:export OLLAMA_MODELS_URL=https://modelscope.cn —— 部分镜像可用;或用 huggingface-cli download 下 GGUF 后放 ~/.ollama/models/;
  2. 先下载小模型试水:7B 的 qwen3.7:7b 仅 ~4GB,2 分钟内下完验证环境正常,再下大模型;
  3. 统一内存架构占优:Apple Silicon M 系列共享内存让大模型加载极快,M2 64G 可流畅跑 30B+ 模型;
  4. 持久对话:ollama run qwen3.7 --keepalive 60m 保持 60 分钟会话(默认 5 分钟自动卸载);
  5. 预加载模型:ollama run qwen3.7 --verbose 看实时 GPU/CPU/内存占用;
  6. 模型版本固定:ollama pull qwen3.7:14b-instruct-q4_K_M(避免自动更新);
  7. 并行测试不同模型:开多个 terminal,各跑一个模型,对比输出质量;
  8. 用 Open WebUI 提升体验:比命令行交互更友好,支持多模型对比、对话历史管理、图片上传。

常见踩坑

踩坑 1:模型下载慢或失败

  • 症状:ollama pull 卡在 0% 或下载速度极慢(< 100KB/s)
  • 原因:模型文件托管在境外,国内直连慢;有时临时网络故障
  • 解决:① 临时用代理(export https_proxy=http://127.0.0.1:7890);② 从 ModelScope 手动下载对应 GGUF 后放 ~/.ollama/models/;③ 用国内镜像站(如有);④ 选小模型先下

踩坑 2:内存不足导致 OOM

  • 症状:运行大模型时系统卡死、Ollama 报错退出、Mac 弹出「磁盘空间不足」
  • 原因:模型参数量超过物理内存(70B Q4 需 ~40GB、Q8 需 ~70GB)
  • 解决:① 选小模型(7B/13B);② 用更高量化(qwen3.7:q3_K_Mq4_K_M 减重 30%);③ 用 ollama ps 看实时内存占用;④ Apple Silicon 优先(统一内存)

踩坑 3:API 端口冲突

  • 症状:ollama serveaddress already in use 或启动失败
  • 原因:默认端口 11434 被占用(可能之前有进程没退干净)
  • 解决:① lsof -i :11434 查占用进程,kill 后重启;② OLLAMA_HOST=0.0.0.0:11435 ollama serve 换端口;③ macOS 重启 Ollama 桌面应用

踩坑 4:模型输出乱码或截断

  • 症状:中文输出变成乱码、英文、emoji 或回复被截断在中间
  • 原因:① 模型本身中文支持差(老 Llama 2);② context window 太小超过模型上限;③ 多模态 / 代码任务用了纯文本模型
  • 解决:① 换中文友好模型(Qwen、DeepSeek、智谱 GLM、Yi);② 在 Modelfile 里 PARAMETER num_ctx 4096;③ 任务匹配模型能力

踩坑 5:GPU 未被识别

  • 症状:推理速度极慢(< 5 token/s),nvidia-smi 显示 GPU 利用率 0%
  • 原因:NVIDIA 驱动或 CUDA 版本不兼容、macOS 没给终端 GPU 权限
  • 解决:① Linux:确保驱动 525+ / CUDA 12+,ollama run --gpu all 强制 GPU;② macOS:在「系统设置 - 隐私与安全 - 开发者工具」允许你的终端;③ 用 OLLAMA_DEBUG=1 ollama serve 看启动日志

踩坑 6:多用户共享同一台机器

  • 症状:不同用户 ollama list 看到不同结果,模型不互通
  • 原因:每个用户账号下有独立的 ~/.ollama/models/
  • 解决:sudo mkdir -p /usr/share/ollama && sudo chown ollama:ollama /usr/share/ollama,设 OLLAMA_MODELS=/usr/share/ollama(systemd 配置),所有用户共享一份模型存储

踩坑 7:WSL2 下性能差

  • 症状:WSL2 里 Ollama 跑得很慢,GPU 不工作
  • 原因:WSL2 默认不分配 GPU 或显存过小
  • 解决:① 用 Windows 11 + 最新 WSL2 + NVIDIA CUDA on WSL 驱动;② .wslconfig[wsl2] memory=16GB;③ 或装原生 Windows Ollama(2024 后支持)

常见问题 FAQ

Q1: Ollama 和 LM Studio 有什么区别?

A: Ollama 是命令行工具 + 后台 API 服务,适合开发者和自动化场景,生态好(可嵌入 Dify / Coze);LM Studio 是图形界面工具,适合非技术用户,有可视化的模型管理、对话、benchmark。两者底层都用 llama.cpp。Ollama 的 API 兼容 OpenAI 格式,可以无缝接入各类 AI 应用 —— 这是 LM Studio 没有的最大优势。多数开发者选 Ollama,纯用户选 LM Studio。

Q2: 可以同时运行多个模型吗?

A: 可以,但并发加载多模型受内存限制。ollama serve 默认是单进程,但可以同时为多个模型提供服务(API 第一次请求时按需加载,后续自动 keepalive)。Mac M2 64G 实测可同时跑 Qwen 7B + DeepSeek 13B,Windows 32G + RTX 4060 可跑 Qwen 7B + Llama 13B(部分量化)。监控用 ollama ps

Q3: 本地模型效果和云端差距大吗?

A: 取决于模型:简单任务(问答、写作、翻译),本地 7B-13B 模型已经接近 GPT-3.5;复杂推理(数学、编程、长文档),建议 70B+ 或云端模型。具体推荐:

  • 7B 模型:替代 GPT-3.5 基本对话;
  • 13B / 14B 模型:中等复杂度任务,体感接近 Claude Sonnet;
  • 70B 模型:复杂任务可对标 GPT-4;
  • 量化损失:4-bit 量化通常损失 < 2%,体感差异很小。

Q4: 如何把 Ollama 接入我的应用?

A: Ollama 提供完全兼容 OpenAI 的 REST API(端点 http://localhost:11434/v1),只需把 base_url 改为这个地址。Python:openai.OpenAI(base_url="http://localhost:11434/v1", api_key="ollama"),Node.js:new OpenAI({baseURL: "...", apiKey: "ollama"}),LangChain:ChatOllama(model="qwen3.7"),LlamaIndex:Ollama(model="qwen3.7")。所有原 OpenAI 代码几乎无改动即可运行。

Q5: 支持微调模型吗?

A: 不支持。Ollama 只做推理。微调用 LlamaFactory(中文友好)、Unsloth(高效低显存)、Axolotl(灵活)、HuggingFace TRL(官方)。微调完成后模型导出为 GGUF 格式,然后用 Modelfile + ADAPTER 指令挂载到 Ollama 即可,无需格式转换

Q6: Ollama 安全吗?

A: ① API 默认绑定 127.0.0.1,只能本机访问;② 启动时会询问是否允许外部访问(OLLAMA_HOST=0.0.0.0);③ 没有内建认证 —— 如果对外暴露,建议放在 Nginx 后面加 basic auth;④ 模型文件 MD5 校验,Ollama Hub 上的模型做了 signature 验证。不要把 Ollama 直接暴露在公网 —— 数据虽不出本机,但 API 调用没限额,可能被滥用。

Q7: Ollama 在国内能正常用吗?

A: 基本能用,但:① 模型下载慢或失败(主要问题),需代理或 ModelScope 镜像;② GitHub 访问慢对升级 Ollama 客户端不友好;③ 社区支持主要在英文圈,中文教程较少;④ 国内云厂商也提供类 Ollama 服务(模搭、ChatGLM 私域版等)可作为备选。

进阶学习建议

Ollama 看似「一键启动」,但想「玩得溜」需要懂模型、量化、推理优化、Modelfile 等。建议四阶段:

  • 第 1 阶段:基础跑通(半天):本文 3 步上手 + ollama list/run/pull/rm 命令。这一阶段目标是能在命令行跑模型回答问题,并能用 Python/Node 调本地 API;
  • 第 2 阶段:Modelfile 与适配器(1~3 天):学习 Modelfile 语法(FROM / PARAMETER / SYSTEM / ADAPTER / TEMPLATE)、调 temperature / top_p / num_ctx 等参数对输出的影响;尝试基于 Qwen 创建一个有「个性化 prompt」的专属模型;
  • 第 3 阶段:集成与生态(1~2 周):把 Ollama 接入你的应用:① Web UI(Open WebUI、Page Assist);② 低代码平台(Dify / Coze / FastGPT);③ RAG(AnythingLLM + LlamaIndex);④ VS Code(Coder / Continue 插件)。掌握不同场景该选什么搭档;
  • 第 4 阶段:深入推理优化(2~4 周):用 ollama psnvtop / powermetrics 监控资源、研究为什么某些 prompt 慢、为什么 GPU 没利用上;对极端场景迁移到 llama.cpp 直接控制;研究 GGUF 量化对不同任务的影响(MMLU、GSM8K、HumanEval)。

学习资源:① Ollama 官方库 README + docs/:每个版本更新看 release notes;② GitHub Issues / Discussions:几乎所有问题都有解答;③ Reddit r/LocalLLaMA:英文社区最活跃,看一手实战;④ 知乎「本地大模型」话题:中文用户经验分享;⑤ 直接读 llama.cpp 源码:Ollama 是很好的封装层,深入还是要看 llama.cpp。

最佳实践:① 不要为了「用大模型」而用大模型 —— 7B 能解决 80% 日常问题;② 本地 + 云端混合架构:用 OpenRouter / DeepSeek API 做云端兜底,本地做数据敏感的子任务;③ 监控 API 端点:生产环境用 Nginx + auth + rate limit 防滥用;④ 备份 Modelfile:自定义模型的核心是 Modelfile,放进 git 版本控制。

参考链接

本文基于官方文档和公开资料整理,AI辅助生成,MagicNetWorld 尚未完成独立实测

📊 评分与标签

评分说明

总分 9.0/10 · P_优选

📊 可观测社区指标(采集日期:2026-07-23)

  • GitHub: ollama/ollama ★176,654, 🔱11,200+
  • 官方网站: ollama.com
  • Docker Hub: ollama/ollama 500M+ 下载量
  • 模型库: 200+ 预置模型,覆盖 DeepSeek/Qwen/Llama/Mistral/Phi 等主流系列

⚙️ 功能完整度 2.2/2.5

  • 支持 200+ 预置模型一键下载运行,覆盖主流开源模型系列
  • 提供 REST API(兼容 OpenAI 格式),支持 streaming、JSON mode、Function Calling
  • 支持 Modelfile 自定义模型(量化参数、系统提示词、温度等)
  • 支持 CPU/GPU 混合推理,自动检测硬件并选择合适的后端
  • 对比 LM Studio:Ollama 提供 API 服务,适合自动化集成;LM Studio 仅 GUI,适合手动使用
  • 对比 llama.cpp:Ollama 封装了 llama.cpp,提供更友好的用户界面和模型管理;llama.cpp 性能更极致但使用门槛高
  • 缺少模型训练/微调、多模态输入(如图像理解)等高级功能

✨ 输出质量 2.2/2.5

  • 输出质量取决于底层模型,Ollama 本身不改变模型推理结果
  • 支持的量化格式(Q4_K_M、Q5_K_M、Q8_0 等)在精度和速度间取得平衡
  • 4-bit 量化精度损失通常 < 2%,8-bit 几乎无损
  • 对比 vLLM:Ollama 适合个人使用和小规模部署,推理速度不如 vLLM 的 PagedAttention 优化
  • 对比云端 API(如 OpenAI):本地模型推理质量天然低于云端大模型,但隐私性更好

🖐️ 易用性 1.5/1.5

  • 安装极简:一行命令或双击安装包,无需配置 Python/CUDA 环境
  • 命令行交互直观:ollama run model-name 即可开始对话
  • API 兼容 OpenAI SDK,改 base_url 即可迁移现有代码
  • 支持 macOS/Linux/Windows 三大平台
  • 对比 LM Studio:命令行更适合开发者,LM Studio 图形界面更适合非技术用户
  • 对比 LocalAI:Ollama 安装更简单,LocalAI 功能更多但配置复杂

💰 性价比 1.5/1.5

  • 完全免费开源(MIT 协议)
  • 零 API 费用:模型推理不消耗 token,无使用限制
  • 硬件成本:7B 模型仅需 8GB 内存的普通电脑,70B 模型需要 32GB+
  • 对比云端 API(DeepSeek ¥1/百万 token):每天 1000 次调用可节省数千元/月
  • 对比 GPT-4o API($2.50/百万 token):本地推理成本为零,适合高频使用场景

🔒 稳定性 0.8/1.0

  • 项目维护活跃:GitHub 提交频繁,社区贡献者 500+
  • 版本迭代快:定期发布新版本和模型支持
  • 存在偶发内存泄漏和 GPU 兼容性问题
  • 对比 LM Studio:稳定性相当,但 Ollama 的 API 服务模式在长时间运行时更稳定
  • 对比 llama.cpp:Ollama 封装层可能引入额外延迟和稳定性问题

🛡️ 隐私安全 0.8/1.0

  • 数据完全本地:所有推理在本地完成,不上传任何数据
  • 开源代码可审计:MIT 协议,无隐藏遥测
  • 默认无网络访问:模型下载后可完全离线运行
  • 对比云端 API:隐私优势明显,适合处理敏感数据
  • 对企业级安全需求(审计日志、访问控制、数据加密)支持不足

🏷️ 标签说明

  • 免费: 完全免费开源,MIT 协议。来源:Ollama GitHub
  • 开源模型: 支持 200+ 开源模型一键部署。来源:Ollama 模型库
  • 本地部署: 数据不出本机,完全离线运行。来源:Ollama 官网
  • 开发平台: 提供 REST API 和 OpenAI 兼容接口。来源:Ollama API 文档

📋 来源核实

  • ✅ 已验证: ollama.com — 官网功能和下载页
  • ✅ 已验证: GitHub ollama/ollama — Stars、License、活跃度
  • ✅ 已验证: Ollama 模型库 — 200+ 模型支持
  • ⚠️ 未实测: 量化精度损失指标 — 基于 llama.cpp 社区报告
  • ⚠️ 声明: 输出质量评分取决于底层模型,Ollama 作为推理引擎不改变模型输出

同分类推荐

AI开发平台 分类下的其他工具

)}