x
This commit is contained in:
+6
-3
@@ -38,14 +38,17 @@
|
||||
},
|
||||
"Qwen3.5-27B-FP8": {
|
||||
"local_path": "Qwen3.5-27B-FP8",
|
||||
"dtype": "bfloat16",
|
||||
"dtype": "auto",
|
||||
"ctx": "65536",
|
||||
"trust_remote": true,
|
||||
"valid_tp": [1, 2],
|
||||
"max_num_seqs": "4",
|
||||
"max_num_seqs": 12,
|
||||
"max_tokens": "8192",
|
||||
"enforce_eager": false,
|
||||
"gpu_util": "0.94",
|
||||
"gpu_util": "0.9",
|
||||
"kv_cache_dtype": "fp8",
|
||||
"enable_prefix_caching": true,
|
||||
"max_num_batched_tokens": 16384,
|
||||
"tool_call_parser": "qwen3_coder",
|
||||
"reasoning_parser": "qwen3",
|
||||
"enable_auto_tool_choice": true,
|
||||
|
||||
@@ -17,6 +17,14 @@ services:
|
||||
VLLM_RPC_TIMEOUT: "300"
|
||||
VLLM_WORKER_MULTIPROC_METHOD: "spawn"
|
||||
PYTHONUNBUFFERED: "1"
|
||||
# 启用 AITER 加速(R9700 属于 gfx1201 架构)
|
||||
VLLM_ROCM_USE_AITER: "1"
|
||||
VLLM_USE_AITER_UNIFIED_ATTENTION: "1"
|
||||
VLLM_ROCM_USE_AITER_MHA: "0"
|
||||
# 增强 All-Reduce 性能(双卡通信优化)
|
||||
VLLM_ROCM_QUICK_REDUCE_QUANTIZATION: "INT4"
|
||||
# 使用 vLLM V1 引擎(性能更好)
|
||||
VLLM_USE_V1: "1"
|
||||
devices:
|
||||
- /dev/kfd
|
||||
- /dev/dri
|
||||
|
||||
Reference in New Issue
Block a user