# vLLM 参数配置文件 # 用于定义和识别 vLLM 服务器的各类参数 # 模型参数配置 model_params: # 必需参数 required: - path # 模型路径 # 可选参数 optional: - name # 模型名称 - dtype # 数据类型 (auto, float16, float32, bfloat16) - quantization # 量化方式 (awq, gptq, squeezellm) - trust_remote # 是否信任远程代码 # 性能参数配置 performance_params: # GPU 相关 gpu: - tensor_parallel_size # 张量并行度 - pipeline_parallel_size # 流水线并行度 - gpu_memory_utilization # GPU 内存利用率 (0.0-1.0) - swap_space # CPU 交换空间大小 (GB) - max_num_batched_tokens # 最大批量 tokens 数 - max_num_seqs # 最大并发请求数 - num_scheduler_steps # 调度器步数 # 内存管理 memory: - block_size # 块大小 (8, 16, 32) - max_model_len # 最大模型上下文长度 - max_logprobs # 最大 logprobs 数 - disable_sliding_window # 禁用滑动窗口 # 服务参数配置 server_params: # 网络配置 network: - host # 服务器主机地址 - port # 服务器端口 - ssl_keyfile # SSL 密钥文件 - ssl_certfile # SSL 证书文件 - ssl_ca_certs # SSL CA 证书 - ssl_keyfile_password # SSL 密钥密码 # API 配置 api: - api_key # API 密钥 - allowed_origins # 允许的源 - timeout_keep_alive # 保持连接超时时间 # 采样参数配置 sampling_params: # 温度控制 - temperature # 温度 (0.0-2.0) - top_p # 核采样参数 (0.0-1.0) - top_k # Top-K 采样 - min_p # 最小概率 # 惩罚参数 - frequency_penalty # 频率惩罚 (-2.0 到 2.0) - presence_penalty # 存在惩罚 (-2.0 到 2.0) - repetition_penalty # 重复惩罚 # 生成长度 - max_tokens # 最大生成 tokens 数 - min_tokens # 最小生成 tokens 数 - stop # 停止词列表 - stop_token_ids # 停止 token IDs # 其他采样选项 - seed # 随机种子 - use_beam_search # 使用束搜索 - best_of # 束搜索的最佳候选数 - length_penalty # 长度惩罚 - early_stopping # 早期停止 - ignore_eos # 忽略 EOS token - skip_special_tokens # 跳过特殊 tokens - spaces_between_special_tokens # 特殊 tokens 之间的空格 # 日志参数配置 logging_params: - log_level # 日志级别 (debug, info, warning, error) - log_requests # 是否记录请求 - log_responses # 是否记录响应 # 高级参数配置 advanced_params: # 执行模式 - enforce_eager # 强制使用 eager 模式 - cuda_graphs # CUDA 图 - use_v2_block_manager # 使用 V2 块管理器 # 注意力后端 - use_rocm_attn # 使用 ROCm 注意力后端 - attention_backend # 注意力后端类型 # 分布式 - distributed_executor_backend # 分布式执行器后端 - ray_workers_use_nsight # Ray workers 使用 nsight # 其他 - load_format # 加载格式 - download_dir # 下载目录 - revision # 模型版本 - code_revision # 代码版本 - tokenizer_revision # tokenizer 版本 # 参数类型映射 param_types: # 整数类型 integer: - tensor_parallel_size - pipeline_parallel_size - max_num_batched_tokens - max_num_seqs - block_size - max_model_len - max_tokens - min_tokens - top_k - best_of - seed - num_scheduler_steps - max_logprobs - swap_space - timeout_keep_alive # 浮点数类型 float: - gpu_memory_utilization - temperature - top_p - min_p - frequency_penalty - presence_penalty - repetition_penalty - length_penalty # 布尔类型 boolean: - trust_remote - enforce_eager - use_rocm_attn - use_beam_search - early_stopping - ignore_eos - skip_special_tokens - spaces_between_special_tokens - log_requests - log_responses - disable_sliding_window - use_v2_block_manager # 字符串类型 string: - path - name - dtype - quantization - host - port - api_key - ssl_keyfile - ssl_certfile - ssl_ca_certs - ssl_keyfile_password - log_level - attention_backend - load_format - download_dir - revision - code_revision - tokenizer_revision # 列表类型 list: - stop - stop_token_ids - allowed_origins # 参数默认值 param_defaults: host: "0.0.0.0" port: 8000 dtype: "auto" gpu_memory_utilization: 0.9 max_model_len: 8192 tensor_parallel_size: 1 max_num_seqs: 256 block_size: 16 temperature: 0.7 top_p: 0.9 max_tokens: 256 enforce_eager: false trust_remote: false log_level: "info" # 参数验证规则 param_validation: gpu_memory_utilization: min: 0.0 max: 1.0 temperature: min: 0.0 max: 2.0 top_p: min: 0.0 max: 1.0 min_p: min: 0.0 max: 1.0 frequency_penalty: min: -2.0 max: 2.0 presence_penalty: min: -2.0 max: 2.0 tensor_parallel_size: min: 1 max: 8 block_size: allowed_values: [8, 16, 32] # 参数分组(用于配置文件组织) param_groups: basic: name: "基础配置" params: - path - name - port - api_key performance: name: "性能配置" params: - tensor_parallel_size - gpu_memory_utilization - max_model_len - max_num_seqs - block_size sampling: name: "采样配置" params: - temperature - top_p - max_tokens - frequency_penalty - presence_penalty - stop advanced: name: "高级配置" params: - dtype - quantization - enforce_eager - trust_remote - swap_space