Ollama 运行本地模型

阅读 10
标签: AI

Ollama允许我们在编程代理中使用开源模型,这样,可以在保持数据私密性的同时减少花费。

安装

安装很简单,直接到官网下载对应操作系统的安装包即可,也可以使用命令。我是安装到Windows 10上的,下载后得到一个二进制安装包,安装即可。

 安装完成后, 打开终端,输入版本号进行验证:

ollama --version

显示的结果是0.33.1版本。

将第一个大模型跑起来

因为我的GPU只有6GB显存,为了用它来帮我写文章,我选择了qwen2.5-7B

接下来,就是拉取模型到本地:

ollama run qwen2.5:7b

默认会下载4bit量化版本的,但是,这个下载极慢,因为是国外的,实在忍受不了。

经过一番摸索,我找到了modelscope,这个是阿里巴巴AI团队搞的一个开源模型网站。

在网站上找到 千问2.5-7B-Instruct-GGUF,请注意,千万不要:

ollama pull Qwen/Qwen2.5-7B-Instruct-GGUF

因为默认下载得到的是2bit量化版,这个精度损失有点多,我需要的是4bit量化版Q4_K_M

所以,我们需要在右侧找到Q4_K_M版本的,其文件大小为4.68GB:

点击进去,会下载gguf文件,会有两个文件:

  • qwen2.5-7b-instruct-q4_k_m-00001-of-00002.gguf
  • qwen2.5-7b-instruct-q4_k_m-00002-of-00002.gguf

1. 都下载下来,并放入到某个文件夹中(比如:D:\models\qwen\目录下)

2. 创建一个名为 Modelfile 的文本文件(没有扩展名),内容只有一行:

FROM ./qwen2.5-7b-instruct-q4_k_m-00001-of-00002.gguf

3. 在该文件夹中打开一个终端(PowerShell 或 CMD),并执行以下命令来创建模型并起个名字:

ollama create qwen2.5-7b:q4 -f ./Modelfile

4. 创建完成后,运行即可:

ollama run qwen2.5-7b:q4

成功启动后,就可以使用了:

发现速度并不是很快,可能我的GTX 1060 max-q性能有限。

最后,如果下载大模型非常慢,除了modelscope外,还可以去https://hf-mirror.com/这个huggingface中国镜像网站来下载大模型。

事故回放

另外,中途出了少许问题,一个是大模型跑起来后,直接蓝屏死机:

提示,终止代码:video_memory_management_internal,原因是显卡驱动太旧,换了一个更新的显卡驱动就好了。

Ollama 常用命令

除了上面的run和pull命令外,还有一些常用的命令:

  • ollama list:查看已安装的模型
  • ollama ps:  查看当前在内存中运行的模型
  • ollama rm 模型名:删除该模型

最后编辑于: 2026-08-29

评论(0条)

(必填)
复制成功