Skip to content

下载 Llama / Qwen / DeepSeek 大模型权重加速指南

大模型权重动辄几十 GB(7B 约 15GB,70B 上百 GB),直连 Hugging Face 又慢又容易断。本文给出国内下载这些权重的最优路径。

首选:ModelScope(魔搭)—— 国内直连,最快

ModelScope 是阿里的模型社区,Qwen、DeepSeek、Llama、GLM 等主流模型基本都有镜像,国内下载速度快、无需代理。

bash
pip install modelscope

# 下载整个模型仓库
modelscope download --model Qwen/Qwen2.5-7B-Instruct --local_dir ./Qwen2.5-7B

# 下载 DeepSeek
modelscope download --model deepseek-ai/DeepSeek-R1-Distill-Qwen-7B --local_dir ./DeepSeek-R1-7B

Python SDK 方式:

python
from modelscope import snapshot_download
model_dir = snapshot_download('Qwen/Qwen2.5-7B-Instruct', cache_dir='./models')

模型 ID 对应关系

ModelScope 上的模型 ID 通常与 Hugging Face 一致或高度相似(如 Qwen/Qwen2.5-7B-Instruct)。找不到时在 modelscope.cn 搜索模型名即可。

次选:hf-mirror 镜像 + 多线程

如果模型只在 Hugging Face 有,用 hf-mirror + hfd 多线程:

bash
export HF_ENDPOINT=https://hf-mirror.com
./hfd.sh meta-llama/Llama-3.1-8B --tool aria2c -x 8 --local-dir ./llama3.1-8b

用 aria2 手动多线程下单个大文件

对单个几十 GB 的 .safetensors,直接 aria2 多线程 + 断点续传:

bash
aria2c -x16 -s16 -c "https://hf-mirror.com/用户/模型/resolve/main/model.safetensors"
  • -c:断点续传(大文件必备)
  • -x16 -s16:16 线程分段

gated 模型(需授权的 Llama 等)

Meta 的 Llama 系列在 HF 是 gated(需同意协议 + token):

  1. 在 Hugging Face 模型页申请并获批;
  2. 生成 access token;
  3. 下载时带 token:
bash
export HF_ENDPOINT=https://hf-mirror.com
huggingface-cli download meta-llama/Llama-3.1-8B --token hf_xxx --local-dir ./llama

拿不到授权 / 镜像不同步时,ModelScope 上常有社区版或等价模型,是最省事的备选。

方案对比

方案需代理速度覆盖模型
ModelScope⭐⭐⭐⭐⭐主流中文/开源模型齐全
hf-mirror + hfd⭐⭐⭐⭐HF 全量(有同步延迟)
aria2 单文件⭐⭐⭐⭐任意直链
代理直连 HF⭐⭐⭐HF 全量、最新

存储与校验提醒

  • 先看清模型大小:70B 全精度可能 130GB+,量化版(GGUF/GPTQ/AWQ)小很多,按需选。
  • 下完用 sha256 或框架自带校验,避免断点续传导致的损坏文件。

小结

  • 国内首选 ModelScope,直连快、主流模型全、免代理。
  • HF 独有模型用 hf-mirror + hfd 多线程
  • 大文件一律开断点续传(aria2 -c / --resume-download)。

本文仅供技术学习与研究,请遵守所在国家/地区法律法规。

本站为技术学习交流站点,与 GitHub, Inc. 无任何隶属或官方关系。所有内容仅供技术研究与学习,请遵守所在国家/地区的法律法规。