Ollama入门指南:让本地电脑轻松运行大模型

Ollama 让大模型完全跑在本地,无需联网、数据不出境、几行命令即可上手。
Ollama 是一款开源的本地大模型运行工具,能将 DeepSeek、通义千问等主流大模型部署到个人电脑上,实现完全离线、数据私密、免费无限次调用。它同时提供命令行(CLI)和图形化 Web UI 两种交互方式,核心命令只有 pull(下载)、run(运行)、rm(删除)几个,上手门槛极低。本地运行的最大制约是硬件,尤其是内存——模型参数越大,所需内存越高,配置不足时模型将无法加载。跑通 Ollama 之后,还可以通过其内置的兼容 OpenAI 格式的本地 API,将模型接入各类第三方客户端或自建应用,为开发者和注重隐私的普通用户都提供了灵活可控的 AI 使用方案。
在线大模型工具用起来很方便,但都绕不开一个前提——必须联网。豆包、DeepSeek、通义千问这些工具本质上都是网页端服务,一旦断网就无法使用,而且所有输入内容都会上传到云端。如果想在完全离线的环境下体验大模型,或者对数据隐私有更高要求,Ollama 是一个值得尝试的方案。这篇教程整理自 B站相关演示视频,带你完整走一遍 Ollama 的安装与使用流程。
Ollama 是什么,能解决什么问题
Ollama 是一个让大模型跑在本地电脑上的工具。简单说,它把原本需要联网访问的大模型下载到你自己的机器里,让你的电脑直接充当一台大模型服务器。
相比在线工具,本地运行主要有三个好处:
- 完全离线:断网也能正常使用,不依赖任何外部服务器。
- 数据私密:所有输入和输出都留在本地,不会上传到任何云端。
- 免费无门槛:不消耗 token,也不需要购买 token 额度,一次配置长期可用。
对于经常处理敏感文档、或者所在网络环境受限的用户来说,这几点相当有吸引力。
从技术架构来看,Ollama 本质上是一个本地模型推理运行时(inference runtime),它将量化压缩后的模型权重文件存储在本地磁盘,并在运行时调用 CPU 或 GPU 进行计算。Ollama 支持的模型格式以 GGUF 为主——这是一种专为本地推理优化的量化格式,能在牺牲少量精度的前提下大幅压缩模型体积。例如,一个原始的 7B 参数模型完整精度下可能需要 14GB 以上存储空间,量化到 4-bit 后往往只需 4-5GB,普通消费级电脑即可运行。Ollama 还内置了一个兼容 OpenAI API 格式的本地服务端(默认监听 localhost:11434),这意味着任何支持 OpenAI 接口的第三方工具,只需把 API 地址指向本机,就能无缝接入本地模型,无需修改其他代码。
两种使用方式:命令行与 Web UI
Ollama 安装完成后提供两种交互方式:一个是命令行(CLI)终端,另一个是图形化的 Web UI 页面。
命令行操作
在终端中,可以先查看本地已经下载了哪些模型。视频作者本地就下载了三个模型,包括通义千问广告(Qwen)和两个 DeepSeek广告 系列模型,其中一个是 DeepSeek R1 的 14B 版本。

要运行某个模型,只需要执行一行命令:
ollama run 模型名称
命令执行后就可以直接输入问题。比如问“你是谁”,模型会快速给出回应;让它写一段代码,也能即时生成结果。整个过程响应速度取决于模型大小和本机硬件配置。
Web UI 操作
如果不习惯命令行,Web UI 提供了和网页聊天几乎一样的体验。安装后 UI 界面会自动打开,切换模型、输入问题的操作都非常直观。对新手来说,这种方式的上手门槛更低。

安装与模型下载全流程
安装 Ollama
安装本身非常简单。前往 Ollama 官网下载对应系统的安装包——Mac 用户下载 Mac 版,Windows 用户下载 Windows 版。需要提醒的是,官网下载速度可能较慢,需要一点耐心。
下载完成后一路“下一步”即可,点击 install,安装过程中如果提示安装运行所需的依赖库,直接确认即可。安装完成后 UI 界面会自动启动,但此时还没有任何可用模型,需要先下载。
下载模型的两种方法
方法一:Web UI 内搜索下载
在 UI 页面直接搜索需要的模型名称,点击并发送消息,系统就会自动开始下载。

方法二:命令行下载
通过命令行执行 ollama pull 模型名称 即可下载。视频作者反馈,命令行下载的体感速度似乎更快一些(也可能是心理作用),他个人更习惯用这种方式。
下载完成后,用查看命令确认模型是否已经就位。当列表中出现新模型时,就说明下载成功,可以在 UI 页面或命令行中调用了。

硬件门槛:内存是关键
视频演示中出现了一个值得注意的插曲:作者在虚拟机里下载好模型后却无法运行。原因是虚拟机分配的系统内存不足,导致模型加载失败。
这提醒我们,本地跑大模型对硬件是有要求的,尤其是内存。模型参数越大(比如 14B 版本),对内存和显存的占用就越高。如果配置不足,要么无法运行,要么响应速度很慢。选择模型时,建议根据自己电脑的实际配置量力而行,从较小的模型开始尝试。
大模型对硬件的要求可以用一个简单的规律来估算:模型参数量(B,十亿)× 量化精度对应的字节数,约等于所需内存/显存。以常见的 4-bit 量化为例,每个参数占约 0.5 字节,7B 模型约需 3.5GB,14B 约需 7GB,70B 则需约 35GB。如果没有独立显卡或显存不足,Ollama 会自动回退到 CPU 推理,此时速度会明显变慢,但至少可以运行。内存(RAM)需要在模型体积基础上额外预留系统开销,通常建议至少留有模型大小 1.5 倍的可用内存。对于入门用户,3B 到 7B 参数的小模型(如 Qwen2.5-7B、Llama3.2-3B)是性价比最高的起点,在 8GB 内存的普通笔记本上即可流畅运行。
常用管理命令
除了运行和下载,日常还会用到几个管理操作:
- 删除模型:把下载命令中的
pull改成rm即可删除对应模型,删除速度很快。 - 停止运行:在模型对话过程中,按
Ctrl + D即可停止当前会话。
掌握这几个命令,就能完成模型的下载、运行、停止和清理,覆盖了绝大多数日常需求。
本地大模型能做什么
跑通 Ollama 只是起点。有了本地大模型服务,可以进一步把它接入到各类工具中,比如集成到 DeepSeek 相关的客户端里使用,或者编写自己的接口来调用模型能力,搭建个性化的 AI 应用。
对于开发者而言,本地模型意味着更自由的实验环境——不用担心 API 费用,也不受调用频率限制。对普通用户来说,它则是一个随时可用、数据自留的私人 AI 助手。
Ollama 把原本复杂的本地部署简化成了几行命令,大幅降低了本地运行大模型的门槛。如果你对数据隐私敏感,或者想在离线环境下用上大模型,不妨按照这篇教程动手试一试。
相关推荐

修复流式排版难题:容器查询与@property的组合技
流式排版在容器达到最大宽度后字号仍持续增长、多容器下字号不一致,是 CSS Fluid Typography 的常见痛点。本文讲解如何用容器查询单位配合 @property 注册自定义属性,锁定统一字号,兼顾响应式布局与设计一致性。

生产环境网站最常用的CSS单位排名揭晓
生产环境网站最常用的CSS单位排名出炉:px居首,em以91.3%覆盖率超越rem,而degrees和seconds竟排进前四。本文解析这份榜单背后的前端现实。

在对象存储上运行Git:重构Packfile的技术思路
探讨如何通过重新生成Packfile让Git运行在S3等对象存储之上。分析Git存储模型与对象存储的兼容难点、打包策略的优势,以及一致性与写放大等现实权衡。