搜索
当前所在位置: 首页>技术支持

三步部署DeepSeek V4模型

发布时间:2026-06-02 14:07:34 作者:超级管理员 点击:41 【 字体:

背景:DeepSeek V4其核心突破在于全系标配 100 token(约 75 万汉字)的超长上下文窗口,并针对效率与性能进行了系统性优化。目前发布了两个版本,分别为DeepSeekV4-Pro(旗舰版) ‌‌DeepSeek V4-Flash(轻量版),下面以DeepSeek V4-Flash(轻量版284B)部署为例展开。

参考链接:

https://docs.vllm.ai/projects/ascend/zh-cn/v0.18.0/tutorials/models/DeepSeek-V4-Flash.html

硬件环境:单机Atlas 800 A2 (64G × 8)

模型下载链接:

https://www.modelscope.cn/models/Eco-Tech/DeepSeek-V4-Flash-w8a8-mtp

镜像下载链接:

https://quay.io/repository/ascend/vllm-ascend?tab=tags


下载完权重和镜像如下所示:

步骤一:加载镜像:

docker load -i quay.io_ascend_vllm-ascend.deepseekv4.tar

图片

图片

步骤二:起容器,Docker run,容器名字可以改为自己名字XX,注意加私有

export IMAGE=quay.io/ascend/vllm-ascend:deepseekv4

export NAME=XX_vllm-ascend

docker run --rm \

--name $NAME \

--net=host \

--shm-size=512g \

--device /dev/davinci0 \

--device /dev/davinci1 \

--device /dev/davinci2 \

--device /dev/davinci3 \

--device /dev/davinci4 \

--device /dev/davinci5 \

--device /dev/davinci6 \

--device /dev/davinci7 \

--device /dev/davinci_manager \

--device /dev/devmm_svm \

--device /dev/hisi_hdc \

--privileged=true \

-v /usr/local/dcmi:/usr/local/dcmi \

-v /usr/local/Ascend/driver/tools/hccn_tool:/usr/local/Ascend/driver/tools/hccn_tool \

-v /usr/local/bin/npu-smi:/usr/local/bin/npu-smi \

-v /usr/local/Ascend/driver/lib64/:/usr/local/Ascend/driver/lib64/ \

-v /usr/local/Ascend/driver/version.info:/usr/local/Ascend/driver/version.info \

-v /etc/ascend_install.info:/etc/ascend_install.info \

-v /etc/hccn.conf:/etc/hccn.conf \

-v /mnt/sfs_turbo/.cache:/root/.cache \

-v /XXX/:/XXX/ \

-it $IMAGE bash

最后XXX为镜像和权重挂在路径。

查看容器内部npu-smi info正常

图片

步骤三:容器内部拉服务,修改模型权重路径

#!/usr/bin/bash

export LD_PRELOAD=/usr/lib/aarch64-linux-gnu/libjemalloc.so.2:$LD_PRELOAD

export OMP_PROC_BIND=false

export OMP_NUM_THREADS=8

export PYTORCH_NPU_ALLOC_CONF=expandable_segments:True

export ACL_OP_INIT_MODE=1

export VLLM_ASCEND_ENABLE_FLASHCOMM1=1

export USE_MULTI_GROUPS_KV_CACHE=1

export TASK_QUEUE_ENABLE=1

export HCCL_OP_EXPANSION_MODE="AIV"

export HCCL_BUFFSIZE=512

export USE_MULTI_BLOCK_POOL=1

sysctl -w vm.swappiness=0

sysctl -w kernel.numa_balancing=0

sysctl kernel.sched_migration_cost_ns=50000

vllm serve /XXX/DeepSeek-V4-Flash-w8a8-mtp \

--safetensors-load-strategy 'prefetch' \

--max-model-len 135168 \

--max-num-batched-tokens 4096 \

--served-model-name ds \

--gpu-memory-utilization 0.92 \

--max-num-seqs 16 \

--data-parallel-size 1 \

--tensor-parallel-size 8 \

--enable-expert-parallel \

--quantization ascend \

 --port 7000 \

--block-size 128 \

--enable-chunked-prefill \

--enable-prefix-caching \

--tokenizer-mode deepseek_v4 \

--tool-call-parser deepseek_v4 \

--enable-auto-tool-choice \

--reasoning-parser deepseek_v4 \

--async-scheduling \

--additional-config '{"enable_cpu_binding":true,"multistream_overlap_shared_expert":false}' \

--compilation-config '{"cudagraph_mode":"FULL_DECODE_ONLY","cudagraph_capture_sizes":[2,4,6,8,10,12,14,16,18,20,22,24,32,36,40]}' \

--model-loader-extra-config '{"enable_multithread_load":true,"num_threads":16}' \

--speculative-config '{"num_speculative_tokens": 1,"method": "mtp"}'

容器拉起来过程截图:

图片

容器拉起来后显存情况:

图片

步骤四:验证服务是否正常(可选)

Model 用服务模型名字--served-model-name ds \,端口号是拉起服务的端口号:--port 7000 \

curl   -H "Accept: application/json" -H "Content-type:   application/json" -X POST -d '{

 "model": "ds",

 "messages": [{

  "role": "user",

  "content": "怎么做番茄炒鸡蛋?"

 }],

 "max_tokens": 1024,

 "seed": null,

 "temperature": 0.6,

 "top_p": 0.95,

 "stream": false

}'  http://XXXX/v1/chat/completions

XXXX为部署主机IP地址。

结果如下:

图片


阅读全文
相关推荐

算力成本失控:CPU两轮涨价超40%,内存半年翻倍,高端GPU租赁排到2027年

算力成本失控:CPU两轮涨价超40%,内存半年翻倍,高端GPU租赁排到2027年
本周服务器硬件全线紧缺态势未改。英特尔第二轮涨价于5月底正式落地,综合涨幅 40%~51% ;内存合约价Q1创单季暴涨 90%以上 历史纪录;高端GPU租赁价格年内再涨近 40% ,H200排期已延至 2027年Q2。AI产业正从“GPU独大”转向 全栈紧缺。一、CPU:涨价加速,两轮累计超40%服务器CPU价格持续走高,英特尔已完成两轮公开涨价:第...

GPU显卡驱动如何安装?

GPU显卡驱动如何安装?
注:GPU服务器建议不要升级内核版本,一旦升级内核后需要重新安装GPU驱动安装GPU驱动$apt-getinstallgccmake$apt-getupdate$wgethttp://cn.download.nvidia.com/XFree86/Linux-x86_64/440.44/NVIDIA-Linux-x86_64-440.44.run$sudochmod+xNVIDIA-Linux-x86_64-440.44.run$s...

豆包即将将“正式收费”!

豆包即将将“正式收费”!
据报,知情人士透露,豆包预计将在6月下旬正式上线付费内容,并于同期举行的Force大会上更新相关功能。之所以选择这一时间节点,是因为PC端与移动端仍需约一个月时间,完成基础功能与收费体系的适配改造。若进展顺利,豆包将于三季度进一步结合电商功能更新完善付费场景,并通过补贴为抖音商城进行引流,四季度进入运行期。...

国产卡是如何兼容CUDA的?

国产卡是如何兼容CUDA的?
都在说CUDA是英伟达最强的护城河,CUDA到底是什么?CUDA是英伟达在2006年推出的并行计算平台,简单说就是一套让程序员把计算任务扔给GPU跑的"语言+工具+规则"。听起来没什么特别,但问题在于,过去二十年,全球AI和深度学习的生态,几乎全部建立在CUDA之上。PyTorch、TensorFlow、各种大模型训练框架,底层都在调...

极智算算力平台|硬核算力底座,赋能 AI 全域高效落地

极智算算力平台|硬核算力底座,赋能 AI 全域高效落地
随着人工智能技术飞速普及,大模型训练、模型微调、AI 推理、高性能计算、数字孪生等场景迎来爆发式增长,稳定、合规、高性价比的算力资源,已成为企业、科研机构与开发者发展的核心刚需。极智算算力平台深耕 GPU 算力服务赛道,聚焦合规算力供给、整机租赁、服务器托管、大模型一站式部署,以顶尖硬件配置、灵活服务模式、...

孙正义重登亚洲首富

孙正义重登亚洲首富
6月2日,福布斯实时富豪榜单显示,软银集团创始人兼CEO孙正义身家攀升至1007亿美元,一举超越印度安巴尼、阿达尼等富豪,时隔十余年再度登顶亚洲首富宝座。软银股价昨日一度大涨14.71%,市值达48万亿日元(约合3060亿美元),超过丰田的约46万亿日元,正式终结丰田连续二十余年霸占日本上市企业市值榜首的纪录。截至今日东京...

三步部署DeepSeek V4模型

三步部署DeepSeek V4模型
背景:DeepSeek V4其核心突破在于全系标配 100 万 token(约 75 万汉字)的超长上下文窗口‌,并针对效率与性能进行了系统性优化。目前发布了两个版本,分别为DeepSeekV4-Pro(旗舰版)‌ 和 ‌‌DeepSeek V4-Flash(轻量版),下面以DeepSeek V4-Flash(轻量版284B)部署为例展开。参考链接:https://docs.vllm.ai/projects/a...

总投资24亿!中国银联黄山数据中心园区项目正式通电

总投资24亿!中国银联黄山数据中心园区项目正式通电
2026年5月23日消息,银联黄山园区项目10KV开关站A/B双回路于近日成功完成高压送电。据悉,银联黄山园区项目位于安徽省黄山市高新技术产业开发区丹霞路与银蝶湖北路交口东北侧部分地块(烟草公司和中科创新广场用地东侧,百川路南侧),是国家关键金融基础设施重要组成部分,也是安徽省重点项目和黄山市头号工程。该项目总投...

Windows系统NVIDIA(英伟达)显卡驱动 安装详细流程

Windows系统NVIDIA(英伟达)显卡驱动 安装详细流程
1.打开浏览器输入【www.nvidia.cn】2.点击【驱动】3.点击【小三角(小图标)】;点击【GeForce】4.笔记本选择带有后缀(Notebooks)的;这里以【笔记本4060显卡】为例①点击【小三角(小图标)】;②点击 GeForce RTX 40Series(Notebooks)】5.笔记本选择带有后缀(Notebooks)的;这里以【笔记本4060显卡】为例①点...

融信云乌兰察布数据中心正式启用

融信云乌兰察布数据中心正式启用
近日,融信云乌兰察布数据中心正式启用,并已顺利完成重要客户灾备业务整体迁移工作。融信云积极响应国家“东数西算”战略号召,将业务核心灾备节点从武汉迁移至乌兰察布,一方面有效降低整体运营能耗与综合成本;另一方面借助当地政策扶持与产业集聚效应,构建起绿色、低碳、弹性的金融算力底座。此次迁移,融信云成功完成...
返回顶部