外观
Ollama 拉取模型慢 / 卡住怎么办?4 种加速方案
ollama pull 拉模型时速度只有几十 KB/s,或者卡在某个百分比不动——因为 Ollama 默认从海外的模型仓库拉取。下面按推荐顺序给方案。
先理解
ollama pull 从 Ollama 官方 registry 拉取分层文件。慢的是这条跨境链路,所以思路是:给它换条路(代理)或从国内源拿到模型文件再本地导入。
方法一:给 Ollama 服务配代理(最通用)
关键点:下载由 ollama 后台服务发起,所以代理要配到服务上,而不是你 shell 的临时变量。
Linux(systemd):
bash
sudo systemctl edit ollama在打开的文件里加入(端口换成你的代理):
ini
[Service]
Environment="HTTPS_PROXY=http://127.0.0.1:7890"
Environment="HTTP_PROXY=http://127.0.0.1:7890"然后重启:
bash
sudo systemctl daemon-reload
sudo systemctl restart ollamamacOS / Windows(桌面版):退出 Ollama,在终端设好代理环境变量后再启动 ollama 服务;或在系统环境变量里加 HTTPS_PROXY。
方法二:从 ModelScope 下 GGUF 再导入(免代理)
国内的 ModelScope(魔搭) 上有大量 GGUF 格式模型,下载快。下载后用 Ollama 的 Modelfile 本地导入:
bash
# 1. 从 ModelScope 下载一个 GGUF 文件(示例)
pip install modelscope
modelscope download --model Qwen/Qwen2.5-7B-Instruct-GGUF qwen2.5-7b-instruct-q4_k_m.gguf --local_dir .
# 2. 写一个 Modelfile
echo 'FROM ./qwen2.5-7b-instruct-q4_k_m.gguf' > Modelfile
# 3. 导入为 ollama 模型
ollama create qwen2.5-7b -f Modelfile
# 4. 运行
ollama run qwen2.5-7b这样完全绕开海外拉取,适合没有稳定代理的环境。
方法三:从 Hugging Face 镜像拉 GGUF
Ollama 支持直接从 Hugging Face 拉 GGUF 模型,配合 hf-mirror 加速:
bash
export HF_ENDPOINT=https://hf-mirror.com
# 用 hf-mirror 下 GGUF,再按方法二 ollama create 导入方法四:断点重试
Ollama 的 pull 支持断点续传——卡住了直接 Ctrl+C,再运行同样的 pull 命令,会从断点继续,而不是重头来:
bash
ollama pull qwen2.5:7b
# 卡住 → Ctrl+C → 再次运行,继续下载配合方法一的代理,大多数情况能顺利拉完。
方案对比
| 方法 | 是否需要代理 | 速度 | 适合 |
|---|---|---|---|
| 一、服务配代理 | 需要 | 高 | 有稳定代理,想直接 ollama pull |
| 二、ModelScope + 导入 | 不需要 | 高 | 无代理,国内环境 |
| 三、HF 镜像 GGUF | 不需要 | 高 | 想要 HF 上的特定量化版 |
| 四、断点重试 | 视情况 | —— | 配合以上任一,应对中断 |
小结
- 有代理:方法一给服务配代理,最省心。
- 没代理:方法二从 ModelScope 下 GGUF 本地导入,完全绕开跨境下载。
- 卡住别慌,Ctrl+C 后重跑即可续传。
本文仅供技术学习与研究,请遵守所在国家/地区法律法规。