Ollama 运行本地模型
Ollama允许我们在编程代理中使用开源模型,这样,可以在保持数据私密性的同时减少花费。
安装
安装很简单,直接到官网下载对应操作系统的安装包即可,也可以使用命令。我是安装到Windows 10上的,下载后得到一个二进制安装包,安装即可。
安装完成后, 打开终端,输入版本号进行验证:
ollama --version显示的结果是0.33.1版本。
将第一个大模型跑起来
因为我的GPU只有6GB显存,为了用它来帮我写文章,我选择了qwen2.5-7B。
接下来,就是拉取模型到本地:
ollama run qwen2.5:7b默认会下载4bit量化版本的,但是,这个下载极慢,因为是国外的,实在忍受不了。
经过一番摸索,我找到了modelscope,这个是阿里巴巴AI团队搞的一个开源模型网站。
在网站上找到 千问2.5-7B-Instruct-GGUF,请注意,千万不要:
ollama pull Qwen/Qwen2.5-7B-Instruct-GGUF因为默认下载得到的是2bit量化版,这个精度损失有点多,我需要的是4bit量化版Q4_K_M。
所以,我们需要在右侧找到Q4_K_M版本的,其文件大小为4.68GB:

点击进去,会下载gguf文件,会有两个文件:
- qwen2.5-7b-instruct-q4_k_m-00001-of-00002.gguf
- qwen2.5-7b-instruct-q4_k_m-00002-of-00002.gguf
1. 都下载下来,并放入到某个文件夹中(比如:D:\models\qwen\目录下)。
2. 创建一个名为 Modelfile 的文本文件(没有扩展名),内容只有一行:
FROM ./qwen2.5-7b-instruct-q4_k_m-00001-of-00002.gguf3. 在该文件夹中打开一个终端(PowerShell 或 CMD),并执行以下命令来创建模型并起个名字:
ollama create qwen2.5-7b:q4 -f ./Modelfile4. 创建完成后,运行即可:
ollama run qwen2.5-7b:q4成功启动后,就可以使用了:

发现速度并不是很快,可能我的GTX 1060 max-q性能有限。
最后,如果下载大模型非常慢,除了modelscope外,还可以去https://hf-mirror.com/这个huggingface中国镜像网站来下载大模型。
事故回放
另外,中途出了少许问题,一个是大模型跑起来后,直接蓝屏死机:

提示,终止代码:video_memory_management_internal,原因是显卡驱动太旧,换了一个更新的显卡驱动就好了。
Ollama 常用命令
除了上面的run和pull命令外,还有一些常用的命令:
- ollama list:查看已安装的模型
- ollama ps: 查看当前在内存中运行的模型
- ollama rm 模型名:删除该模型