文章目录
| ---- | ------ | |
|---|---|---|
| `--tp-size` | 4 | 张量并行度,对应 4 张 910B |
| `--context-length` | 262144 | 最大上下文 256K |
| `--device npu` | — | 指定昇腾 NPU 后端 |
| `--attention-backend` | ascend | 使用昇腾 attention 实现 |
| `--disable-radix-cache` | — | 关闭 radix cache(昇腾场景常用) |
| `--mem-fraction-static` | 0.70 | 静态 KV 缓存显存占比 |
| `--dtype` | bfloat16 | 模型精度 |
| `--reasoning-parser` | qwen3 | 推理模型 reasoning 解析 |
| `--tool-call-parser` | qwen3_coder | 工具调用解析 |
| `--enable-prefill-delayer` | — | 启用 prefill 延迟,配合 max-delay-passes 缓解长输入时的 prefill/decode 抢占 |
调优环境变量解析:
- `STREAMS_PER_DEVICE=32`:提升并发流
- `HCCL_OP_EXPANSION_MODE=AIV`:HCCL 算子扩展模式
- `HCCL_SOCKET_IFNAME=lo` / `GLOO_SOCKET_IFNAME=lo`:多机/多卡走回环网卡
- `SGLANG_ENABLE_SPEC_V2=1`:启用 speculation v2
- `SGLANG_ENABLE_OVERLAP_PLAN_STREAM=0`:关闭计划流重叠
六、注意事项
- 使用的卡号(4,5,6,7)可按实际资源调整,需与容器挂载的设备一致
- `--shared-memory` 与 `--shm-size` 场景下,若出现 OOM 优先检查共享内存大小
- 若需多机部署,将 `HCCL_SOCKET_IFNAME` 改为实际业务网卡并配置 `--nnodes`
- 大上下文场景建议根据显存余量微调 `--mem-fraction-static`
以上为单机 4 卡 TP=4 部署 Qwen3.6-35B-A3B 的完整简记,供后续复用。








COMMENTS | NOTHING