SGLang 在昇腾 910B 部署 Qwen3.6-35B-A3B 简记

发表于 1 天前  13 次阅读


文章目录
----------
`--tp-size`4张量并行度,对应 4 张 910B
`--context-length`262144最大上下文 256K
`--device npu`指定昇腾 NPU 后端
`--attention-backend`ascend使用昇腾 attention 实现
`--disable-radix-cache`关闭 radix cache(昇腾场景常用)
`--mem-fraction-static`0.70静态 KV 缓存显存占比
`--dtype`bfloat16模型精度
`--reasoning-parser`qwen3推理模型 reasoning 解析
`--tool-call-parser`qwen3_coder工具调用解析
`--enable-prefill-delayer`启用 prefill 延迟,配合 max-delay-passes 缓解长输入时的 prefill/decode 抢占

调优环境变量解析:

  • `STREAMS_PER_DEVICE=32`:提升并发流
  • `HCCL_OP_EXPANSION_MODE=AIV`:HCCL 算子扩展模式
  • `HCCL_SOCKET_IFNAME=lo` / `GLOO_SOCKET_IFNAME=lo`:多机/多卡走回环网卡
  • `SGLANG_ENABLE_SPEC_V2=1`:启用 speculation v2
  • `SGLANG_ENABLE_OVERLAP_PLAN_STREAM=0`:关闭计划流重叠

六、注意事项

  • 使用的卡号(4,5,6,7)可按实际资源调整,需与容器挂载的设备一致
  • `--shared-memory` 与 `--shm-size` 场景下,若出现 OOM 优先检查共享内存大小
  • 若需多机部署,将 `HCCL_SOCKET_IFNAME` 改为实际业务网卡并配置 `--nnodes`
  • 大上下文场景建议根据显存余量微调 `--mem-fraction-static`

以上为单机 4 卡 TP=4 部署 Qwen3.6-35B-A3B 的完整简记,供后续复用。


scanz个人博客