DeepSeek 部署方案
从本地到云端,汇总 DeepSeek-R1 的几种落地实践
DeepSeek 是近期非常火爆的开源大模型,国产大模型 DeepSeek 凭借其优异的性能和对硬件资源的友好性,受到了众多开发者的关注。
无奈在使用时,DeepSeek 官方总是提示「服务器繁忙,请稍后再试」,这可怎么办?
万幸的是,DeepSeek 是一个开源模型,这意味着我们可以将它部署在自己的电脑上随时使用,同时各个云厂商也提供了自己的托管方案。今天就跟大家分享一下 DeepSeek 部署的几种方案。
本地部署方案
Ollama
首先需要安装 Ollama。Ollama 是一个用于本地管理和运行大模型的工具,能够简化模型的下载与调度操作。
进入 Ollama 官网(https://ollama.com),点击【Download】,选择适合自己系统的版本(Windows / macOS / Linux)。
以 deepseek-r1 为例,官方提供了如下几个版本:
1.5b
7b
8b
14b
32b
70b
671b说明:1.5b / 7b / 14b / 32b 基于 Qwen2.5 系列,8b 基于 Qwen3,70b 基于 Llama3.3,671b 为 DeepSeek-R1 原版(未蒸馏)。默认
ollama run deepseek-r1(latest标签)拉取的是 8b 版本(DeepSeek-R1-0528-Qwen3-8B)。
启动 DeepSeek 模型:
ollama run deepseek-r1:14b在 Apple M1 Pro / 32 GB 机器上运行 14b 模型毫无压力,可以达到大约 10 token/s 的速度。
如果需要对 API 进行加密,可参考:
llama.cpp
- llama.cpp:LLM inference in C/C++,项目已迁移至
ggml-org组织下。
SGLang
- sglang:SGLang is a fast serving framework for large language models and vision language models,由 LMSYS 开源组织维护。
参考启动命令(两节点分布式部署示例)。
ds1(主节点,node-rank 0):
docker run -e GLOO_SOCKET_IFNAME=bond0 -e NCCL_SOCKET_IFNAME=bond0 -e NCCL_DEBUG=INFO --gpus all \
--shm-size 128g \
--network=host \
-v /modelshare_readonly/deepseek-ai:/deepseek \
--name sglang_multinode1 \
-d \
--restart always \
-p 50000:50000 \
--ipc=host \
--privileged --device=/dev/infiniband:/dev/infiniband \
lmsysorg/sglang:v0.4.2.post4-cu125-srt \
python3 -m sglang.launch_server --model-path /deepseek/DeepSeek-R1 --served-model-name DeepSeek-R1 --enable-metrics --enable-dp-attention --enable-cache-report --tp 16 --dist-init-addr 192.168.253.81:20001 --nnodes 2 --node-rank 0 --trust-remote-code --host 0.0.0.0 --port 50000ds2(从节点,node-rank 1):
docker run -e GLOO_SOCKET_IFNAME=bond0 -e NCCL_SOCKET_IFNAME=bond0 -e NCCL_DEBUG=INFO --gpus all \
--shm-size 128g \
--network=host \
-v /modelshare_readonly/deepseek-ai:/deepseek \
--name sglang_multinode2 \
-d \
--restart always \
-p 50000:50000 \
--ipc=host \
--privileged --device=/dev/infiniband:/dev/infiniband \
lmsysorg/sglang:v0.4.2.post4-cu125-srt \
python3 -m sglang.launch_server --model-path /deepseek/DeepSeek-R1 --served-model-name DeepSeek-R1 --enable-metrics --enable-dp-attention --enable-cache-report --tp 16 --dist-init-addr 192.168.253.81:20001 --nnodes 2 --node-rank 1 --trust-remote-code --host 0.0.0.0 --port 50000vLLM
- vllm:A high-throughput and memory-efficient inference and serving engine for LLMs。
Xinference
- inference:Xinference 是由 Xorbits 开源的模型推理与部署平台,提供 OpenAI 兼容的 API,支持 LLM、Embedding、图像、音频等多类模型。
支持 DeepSeek 的云服务平台
DeepSeek 官方
字节火山引擎
预置推理接入点调用示例:
curl https://ark.cn-beijing.volces.com/api/v3/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $ARK_API_KEY" \
-d '{
"model": "deepseek-r1-250120",
"messages": [
{"role": "system", "content": "你是人工智能助手."},
{"role": "user", "content": "常见的十字花科植物有哪些?"}
]
}'同时也支持自定义在线接入点(Endpoint)。
示例代码如下,ep-20250226225639-lbdsg 即为 Endpoint ID:
curl https://ark.cn-beijing.volces.com/api/v3/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $ARK_API_KEY" \
-d '{
"model": "ep-20250226225639-lbdsg",
"messages": [
{"role": "system", "content": "你是人工智能助手."},
{"role": "user", "content": "常见的十字花科植物有哪些?"}
]
}'其它参考: