Skip to content

Ollama 拉取模型慢 / 卡住怎么办?4 种加速方案

ollama pull 拉模型时速度只有几十 KB/s,或者卡在某个百分比不动——因为 Ollama 默认从海外的模型仓库拉取。下面按推荐顺序给方案。

先理解

ollama pull 从 Ollama 官方 registry 拉取分层文件。慢的是这条跨境链路,所以思路是:给它换条路(代理)从国内源拿到模型文件再本地导入

方法一:给 Ollama 服务配代理(最通用)

关键点:下载由 ollama 后台服务发起,所以代理要配到服务上,而不是你 shell 的临时变量。

Linux(systemd):

bash
sudo systemctl edit ollama

在打开的文件里加入(端口换成你的代理):

ini
[Service]
Environment="HTTPS_PROXY=http://127.0.0.1:7890"
Environment="HTTP_PROXY=http://127.0.0.1:7890"

然后重启:

bash
sudo systemctl daemon-reload
sudo systemctl restart ollama

macOS / Windows(桌面版):退出 Ollama,在终端设好代理环境变量后再启动 ollama 服务;或在系统环境变量里加 HTTPS_PROXY

方法二:从 ModelScope 下 GGUF 再导入(免代理)

国内的 ModelScope(魔搭) 上有大量 GGUF 格式模型,下载快。下载后用 Ollama 的 Modelfile 本地导入:

bash
# 1. 从 ModelScope 下载一个 GGUF 文件(示例)
pip install modelscope
modelscope download --model Qwen/Qwen2.5-7B-Instruct-GGUF qwen2.5-7b-instruct-q4_k_m.gguf --local_dir .

# 2. 写一个 Modelfile
echo 'FROM ./qwen2.5-7b-instruct-q4_k_m.gguf' > Modelfile

# 3. 导入为 ollama 模型
ollama create qwen2.5-7b -f Modelfile

# 4. 运行
ollama run qwen2.5-7b

这样完全绕开海外拉取,适合没有稳定代理的环境。

方法三:从 Hugging Face 镜像拉 GGUF

Ollama 支持直接从 Hugging Face 拉 GGUF 模型,配合 hf-mirror 加速:

bash
export HF_ENDPOINT=https://hf-mirror.com
# 用 hf-mirror 下 GGUF,再按方法二 ollama create 导入

方法四:断点重试

Ollama 的 pull 支持断点续传——卡住了直接 Ctrl+C,再运行同样的 pull 命令,会从断点继续,而不是重头来:

bash
ollama pull qwen2.5:7b
# 卡住 → Ctrl+C → 再次运行,继续下载

配合方法一的代理,大多数情况能顺利拉完。

方案对比

方法是否需要代理速度适合
一、服务配代理需要有稳定代理,想直接 ollama pull
二、ModelScope + 导入不需要无代理,国内环境
三、HF 镜像 GGUF不需要想要 HF 上的特定量化版
四、断点重试视情况——配合以上任一,应对中断

小结

  • 有代理:方法一给服务配代理,最省心。
  • 没代理:方法二从 ModelScope 下 GGUF 本地导入,完全绕开跨境下载。
  • 卡住别慌,Ctrl+C 后重跑即可续传。

本文仅供技术学习与研究,请遵守所在国家/地区法律法规。

本站为技术学习交流站点,与 GitHub, Inc. 无任何隶属或官方关系。所有内容仅供技术研究与学习,请遵守所在国家/地区的法律法规。