2026/9/9 11:15:43

Ollama 安装与使用全指南:本地大模型快速上手指南

Ollama 安装与使用全指南:本地大模型快速上手指南 简介这套 Ollama 安装资源包面向需要在 Linux/macOS 等类 Unix 环境中部署 Ollama 的研发与运维人员覆盖从获取安装包、执行安装脚本、完成基础配置到服务验证的完整流程。压缩包整体只有 13KB包含 3 个文件PHP 脚本负责获取安装包shell 脚本自动检查环境、安装依赖并设置权限txt 说明文档则汇总系统要求、安装步骤、常见报错与处理建议。已有 434 人学习下载特别适合初次接触 Ollama 或希望高效复现部署流程的中初级用户。资料虽精简但内容并不单薄既解释如何自定义安装脚本以适应不同目录或依赖环境也提醒安装前后的注意事项并给出服务启动是否成功的验证方法遇到依赖缺失、权限不足或网络连接等问题时还能依据文档快速定位原因。对没有图形界面的服务器或需要批量部署的场景来说这份材料能有效降低试错成本是完成 Ollama 安装和基础调优的实用参考。 先说结论Ollama 就是目前把大模型拉到本地跑最简单的那条路。装好它你不需要写一行 Python 调用代码不需要懂 CUDA 和显存分配只需要一个命令就能把 Llama、Qwen、DeepSeek 这些开源模型跑起来然后通过一个本地端口去调用它或者接上 Open WebUI、Cherry Studio、VS Code 这类前端工具。这篇文章面向的是想把 Ollama 装好、装明白的人不管你是第一次接触本地大模型的小白还是已经在 Docker 里折腾过 AI 服务的开发者装好之后的模型管理、目录迁移、国内网络加速、API 对接这几个点应该都能帮你少踩几个坑。1. 安装前先搞清楚Ollama 到底是装什么很多人第一次接触“安装 Ollama”这个动作时会把它理解成跟装微信、装 Photoshop 一样的事——双击安装包下一步下一步完事。这个理解没错但很容易忽略一个关键点Ollama 本身只是一个运行引擎就像你装了一个播放器但播放器里还没有任何视频。Ollama 安装完成后你还需要单独执行ollama run qwen2.5这类命令去拉取模型文件才能真正用起来。这个“引擎 模型”分离的架构好处是模型可以随便换随时删磁盘不够了就换个小模型跟引擎互不影响。坏处是如果你只装好了 Ollama 而不去拉模型打开它你会发现界面空空如也甚至有点怀疑自己是不是装错了。1.1 底层逻辑安装包里藏着什么以 Windows 安装包为例OllamaSetup.exe这个文件实际做的事可以拆成三步把 Ollama 主程序解压到%LocalAppData%\Programs\Ollama同时注册为 Windows 服务所以安装完你会在任务管理器里看到ollama.exe和ollama app.exe两个进程一个是后台服务一个是托盘界面。在系统环境变量里写入 Ollama 的路径方便你在终端里直接敲ollama命令。启动后台服务默认监听127.0.0.1:11434这个地址。macOS 版本逻辑类似安装的是.zip或.pkg包程序放在/Applications/Ollama.app模型文件默认放在~/.ollama/models。Linux 版本则是一个二进制文件加一个 systemd 服务脚本模型目录默认在/usr/share/ollama/.ollama/models。理解了这个底层结构后面遇到问题就好排查了。比如你发现ollama命令找不到十有八九是环境变量没生效比如你想把模型装到 D 盘本质就是改OLLAMA_MODELS这个环境变量的指向。1.2 平台支持范围哪些设备能装在动手之前先确认你的设备在支持列表里不然装到一半才发现跑不了白费功夫。平台支持情况关键条件Windows支持Windows 10 22H2 及以上需要 64 位系统macOS支持macOS 13 (Ventura) 及以上Apple Silicon (M 系列) 体验最佳Linux支持主流发行版均可需要 x86_64 或 ARM64 架构Windows 7不支持Ollama 官方从未支持 Win7装不上是正常的低配电脑可装但体验差CPU 模式能跑但速度慢、显存小就别选大模型有个很容易被忽略的点macOS 上如果你还是 Intel 芯片的老机器Ollama 也能装但推理速度和新款 M 系列芯片差距非常明显。Windows 上如果你有 N 卡Ollama 会自动调用 CUDA 走 GPU 加速如果是 A 卡部分场景也能跑但兼容性不如 N 卡纯 CPU 的机器也能跑只是速度要放低预期。2. Windows 安装实操从下载到跑通第一个模型Windows 是大多数人的主战场所以我先把这套流程讲透。整个流程分三步下载安装、确认服务状态、跑通第一个模型。2.1 下载加速国内网络环境的处理方案提到 Ollama 安装网上吐槽最多的就是“下载太慢了”“官网打不开”。https://ollama.com/download这个页面确实在国内访问不稳定GitHub 的 release 文件也经常断流。我试过几种方案最靠谱的是这两个方案 A使用国内镜像站下载安装包国内有一些开源镜像站会同步 Ollama 的安装包比如部分高校镜像站和云厂商的镜像仓库。你不需要改任何配置只需要用镜像地址把安装包下载到本地然后正常双击安装。方案 B手动下载 校验文件如果你能找到直接的下载链接可以用浏览器自带的下载工具或 IDM 这类多线程工具下载比在官网网页上等要快得多。下载完成后建议对照一下官方发布的 SHA256 校验值验证文件完整性和安全性。注意任何从非官方渠道下载的安装包安装前都建议右键查看数字签名确认发布者是 Ollama, Inc.。我见过不少第三方网站捆绑了广告软件安装包里混了额外的东西这个习惯养成没有坏处。2.2 安装到 D 盘两种方式对比“Ollama 怎么安装到 D 盘”这个搜索词出现的频率非常高因为默认装到 C 盘会占用大量空间尤其后面拉模型动不动就是 4-7GB 一个文件。我试过两种方式各有适用场景方式一直接修改模型目录推荐最简单其实从一开始就不用纠结安装目录。Ollama 的主程序非常小100MB 以内真正占空间的是模型文件。你只需要在安装第一个模型之前把模型存放目录指向 D 盘就行。操作步骤按Win键搜索“环境变量”打开“编辑系统环境变量”。点击“环境变量”在“系统变量”区域点击“新建”。变量名填OLLAMA_MODELS变量值填你想存放模型的路径比如D:\ollama\models。确定保存后重启终端窗口环境变量才会生效再执行ollama run命令。方式二安装时直接改路径进阶操作如果你希望主程序也装在 D 盘可以通过命令行静默安装指定目录。打开 PowerShell管理员模式进入安装包所在目录执行.\OllamaSetup.exe /DIRD:\ollama这个方式本质上是让安装程序把主程序文件解压到指定位置。需要说明的是这个操作是我自己试过可行的方案Ollama 官方文档里没有详细描述不同版本的安装包可能行为略有差异如果执行后还是默认路径就退回方式一。2.3 首次启动与验证安装完成后系统托盘区会出现一个羊驼图标。点击图标打开应该是“Ollama is running”的状态。然后在终端里执行ollama --version能正常输出版本号说明核心程序没问题。接着拉取第一个模型我建议从小模型开始比如ollama run qwen2.5:1.5b这个模型大约 1GB 左右下载速度取决于网络环境跑起来后随便输入一句话测试能收到流畅回复就说明整套环境已经通了。提示测试阶段建议先用小模型验证链路不要一上来就拉 70B 的大模型。我见过很多新手因为第一次就下载超大模型等半天没下载完然后以为安装失败了。3. macOS 与 Linux 安装各自的门道macOS 和 Linux 的安装方式比 Windows 简单一些但也有一些各自的坑分开说。3.1 macOS拖拽安装但有一个隐藏设置macOS 的安装非常简单从官网下载Ollama-darwin.zip解压后把Ollama.app拖进“应用程序”文件夹打开就完成了。首次打开时系统会弹“是否确认打开”的提示因为这是非 App Store 应用需要在“系统设置 - 隐私与安全性”里点击“仍要打开”。macOS 上有个比较实用的设置是配置模型存放位置。Apple Silicon 的 Mac 硬盘空间普遍宝贵如果默认识别到的用户目录空间不够可以用同样的环境变量方式把模型放到外置硬盘launchctl setenv OLLAMA_MODELS /Volumes/ExternalDrive/ollama-models设置完成需要退出 Ollama 并重新打开才生效。这个命令只对当前用户会话生效重启后需要重新设置如果你想持久化就得写个 LaunchAgent 脚本那属于进阶操作这里不展开。3.2 Linux一条命令脚本和手动部署Linux 安装 Ollama 非常简单一行命令curl -fsSL https://ollama.com/install.sh | sh这个脚本会自动识别你的发行版和 GPU 环境装好主程序、创建 systemd 服务、配置好开机自启。装完同样执行ollama --version验证。但如果你的服务器访问官网脚本超时或者你想离线部署到内网机器就需要手动部署从 GitHub Releases 页面下载ollama-linux-amd64.tgz或对应架构的包。解压到指定目录tar -C /usr/local -xzf ollama-linux-amd64.tgz手动启动服务nohup ollama serve /tmp/ollama.log 21 离线部署多用在企业内网环境因为模型文件也需要内网分发这种情况建议配合 ModelScope 或 HuggingFace 的离线下载工具一起用模型文件放到OLLAMA_MODELS指向的目录即可。3.3 WSL 2 的使用场景与内存配置Windows 上很多开发者喜欢用 WSL 2Windows Subsystem for Linux而不是原生 Windows 版本跑 Ollama原因是 Linux 环境下做开发联调更顺模型推理的兼容性问题也少一些。WSL 2 里安装 Ollama 和 Linux 安装方式一样直接用官方脚本即可。但有一个管理上的坑必须提醒WSL 2 使用的虚拟磁盘ext4.vhdx会自动膨胀删除模型后磁盘空间不会自动回收。如果你频繁拉取和删除不同模型Windows 的 C 盘空间会越来越小。解决方法是在 PowerShell 里执行wsl --shutdown diskpart # 选择 WSL 的 vhdx 文件 # 执行 compact vhdx如果觉得手动操作太麻烦也可以把 WSL 的虚拟磁盘整体移动到其他分区网上有现成工具这里点到为止。4. 模型下载加速国内镜像源与手动导入装好 Ollama 之后最大的痛点就变成了模型下载。“ollama pull 太慢”“一直卡在 downloading”这类问题几乎每个新手都会遇到。Ollama 的模型文件托管在 GitHub Release 或 Docker Hub 这类平台国内直连速度确实不理想但这个有合法的解决方案不需要任何旁门左道。4.1 方案一配置国内代理环境变量如果你有可用的 HTTP 代理服务比如自己搭的或者公司提供的可以通过环境变量让 Ollama 走代理下载Windows 系统变量里添加HTTP_PROXYhttp://你的代理地址:端口 HTTPS_PROXYhttp://你的代理地址:端口然后重启 Ollama 服务。这个方案的优点是所有模型下载都能加速缺点是你得先有一个可用的代理服务。4.2 方案二从 ModelScope 手动下载 GGUF 文件再导入阿里旗下的 ModelScope魔搭社区上有大量模型的 GGUF 格式文件国内下载速度很快。操作思路是先用modelscope下载模型文件再让 Ollama 识别这个文件。具体步骤如下安装 modelscope 下载工具pip install modelscope下载某个模型的 GGUF 文件以 Qwen2.5-7B-Instruct 为例modelscope download --model Qwen/Qwen2.5-7B-Instruct-GGUF --local_dir ./models --include qwen2.5-7b-instruct-q4_k_m.gguf编写 Modelfile 文件指明模型位置FROM ./models/qwen2.5-7b-instruct-q4_k_m.gguf用ollama create创建可用的模型ollama create qwen2.5-7b -f Modelfile验证ollama run qwen2.5-7b这套流程的核心价值在于绕开了 Ollama 官方仓库直接从国内下载模型文件。模型文件内容完全一样运行效果没有区别。我实际测试下来q4_k_m 量化的 7B 模型文件大约 4.7GBModelScope 下载速度可以跑到 10MB/s 以上比直连官方仓库稳定得多。4.3 方案三改 OLLAMA_HOST 做多机共享还有一种进阶玩法在一台下载速度快、配置好的机器上下载好模型然后把OLLAMA_MODELS目录整个复制到另一台机器。只要版本一致直接就能用不需要重新下载。这个方法对多台电脑、内网部署的场景很实用。5. 安装后的常用操作与 API 接入Ollama 装好只是起点。真正实用的是把它暴露成一个本地 API 服务接到各种应用里。这个过程比大多数人想象中简单得多。安装完成后Ollama 会自动在后台监听11434端口。直接访问http://localhost:11434如果返回Ollama is running说明服务在正常监听。5.1 核心命令速查命令作用使用频率ollama list查看本地已下载的模型列表极高ollama run 模型名进入交互式对话极高ollama pull 模型名下载指定模型高ollama rm 模型名删除指定模型高ollama ps查看当前加载在内存中的模型中ollama serve启动 API 服务默认已自启低ollama stop 模型名停止正在运行的模型中5.2 本地 API 调用示例用 Python 调用是很多人的刚需场景。最简方式是用requests发一个 POST 请求不需要任何官方的 SDKimport requests import json response requests.post( http://localhost:11434/api/generate, json{ model: qwen2.5:7b, prompt: 用一句话介绍你自己, stream: False } ) result response.json() print(result[response])更进阶的玩法是接 OpenAI SDK因为 Ollama 提供了兼容 OpenAI 的接口。你只需要改 base_urlfrom openai import OpenAI client OpenAI( base_urlhttp://localhost:11434/v1, api_keyollama # 随便填Ollama 本地不校验 ) response client.chat.completions.create( modelqwen2.5:7b, messages[{role: user, content: 写一段 Python 快排}] ) print(response.choices[0].message.content)这个兼容接口非常实用很多原本面向 OpenAI API 开发的应用只需要切换 base_url 就能直接对接本地模型。比如 VS Code 里装 Claude Code 插件后配置指向http://localhost:11434/v1就能用本地模型辅助写代码。5.3 推荐几个周边工具装好 Ollama 之后有几个工具我几乎每天都在用Open WebUI一个非常成熟的前端界面安装后能在浏览器里像 ChatGPT 一样对话支持多用户、知识库上传。Cherry StudioWindows 上极好用的桌面客户端自带模型管理界面跟 Ollama 无缝对接。ContinueVS Code 插件能在 IDE 里调用本地模型做代码补全和 Chat 问答。这些工具的安装方式基本都是“软件本身 指向 Ollama 的接口地址”没有太多技术门槛按提示操作就行。6. 常见问题排查安装失败与运行异常实录最后这部分是我最想写的。这些坑都是我实际踩过或者帮别人排查过的整理成速查表遇到问题先照着查一遍能省下大量搜索时间。6.1 常见错误速查表问题现象可能原因解决方案ollama命令无法识别环境变量未生效重启终端在系统环境变量里确认路径存在官网安装包下载极慢网络访问不稳定用国内镜像站或手动下载工具加速提示“Windows 7 不支持”系统版本过低升级系统Ollama 明确要求 Win10 22H2模型下载卡在 0% 或中途失败网络断流配置代理环境变量从 ModelScope 手动下载导入启动后端口 11434 被占用其他服务占用了端口修改端口环境变量OLLAMA_HOST0.0.0.0:11435重新指定模型回答速度极慢CPU 模式或小内存确认 GPU 驱动版本减少上下文窗口长度如/set parameter num_ctx 2048提示 OOM 显存不足模型过大超出显存换小模型选用量化更低的版本如 Q4 转 Q2安装后被安全软件拦截误报行为去安全软件隔离区恢复文件确认安装包来源可信6.2 WSL 安装太慢的处理方法搜索词里有一个“wsl --install 太慢”这其实是个热门问题而且常和 Ollama 组合出现。如果你打算在 WSL 里装 Ollamawsl --install卡住是很常见的情况原因通常是服务器连接速度不理想。解决思路有几个我推荐先试第一种挂代理跑wsl --install如果代理可用的话下载速度会明显改善。从微软官网手动下载 WSL 的安装包.msixbundle然后用Add-AppxPackage命令安装绕开命令行拉取流程。如果只是不想让 WSL 虚拟磁盘占 C 盘可以先把 WSL 装好后用wsl --export和wsl --import把它迁移到 D 盘。6.3 API 调用连接失败的处理思路如果你把 Ollama 接入 Cherry Studio 或 Claude Code 时发现“连不上”不要慌按这个顺序排查先确认 Ollama 服务在运行。在浏览器访问http://localhost:11434如果页面显示Ollama is running说明服务层面没问题。再确认你填的地址对不对。很多工具要求填http://localhost:11434而不是http://127.0.0.1:11434虽然本质上一样但某些工具坑很多只要有一个地方拼写不一致就连不上。最后确认端口有没有被改过。如果你之前设置过OLLAMA_HOST环境变量改了端口所有客户端请求都要跟着改。6.4 我的一个小建议先定好目录再开始最后分享一个经验。装 Ollama 这个动作本身难度不大但如果你一开始就规划好“模型文件放哪、数据目录放哪”后面能省很多事。我一开始就是随手装在了默认目录结果玩了几天模型之后C 盘被塞了 20 多个 G最后不得不手动迁移模型目录重启服务折腾了一上午。所以我的建议是不管是 Windows、macOS 还是 Linux第一步先把OLLAMA_MODELS或~/.ollama指向一个空间充裕的分区然后再开始拉模型。这个操作花不了两分钟却能避免后面最大的那个坑。另外再补一个实用经验Ollama 下载大模型时如果中断重新执行ollama pull会断点续传不需要从头开始所以看到下载卡住时别急着删了重来先等一等或者重启服务试试。本地模型这块现在发展很快Ollama 本身也在不停迭代。你不需要一次性搞懂所有功能先把安装、模型下载、接口调用这三件事跑通就已经超过大多数人了。后面再慢慢研究多模型切换、Docker 部署、嵌入到自己的应用里都是水到渠成的事。本文还有配套的精品资源点击获取