x
This commit is contained in:
@@ -7,6 +7,7 @@
|
||||
- 提供可容器化部署的模型推理 API
|
||||
- 使用 vLLM 在双 GPU 上进行张量并行推理
|
||||
- 提供健康检查、鉴权和参数化配置能力
|
||||
- 暴露 `8001` OpenAI 标准协议接口,兼容 OpenClaw 调用
|
||||
|
||||
## 目录结构
|
||||
|
||||
@@ -57,6 +58,8 @@
|
||||
- `MODEL_CONFIG_FILE`:模型配置文件路径,默认 `config.json`
|
||||
- `MODEL_KEY`:要启动的模型键,留空时使用 `config.json` 中 `default_model`
|
||||
- `MODEL_NAME`:兜底模型名(仅在不使用配置文件时生效)
|
||||
- `OPENAI_HOST`:OpenAI 协议服务监听地址,默认 `0.0.0.0`
|
||||
- `OPENAI_PORT`:OpenAI 协议服务监听端口,默认 `8001`
|
||||
- `TENSOR_PARALLEL_SIZE`:张量并行数,双卡建议为 `2`
|
||||
- `GPU_MEMORY_UTILIZATION`:单卡显存利用率,建议 `0.90~0.95`
|
||||
- `MAX_MODEL_LEN`:模型最大上下文长度
|
||||
@@ -104,12 +107,18 @@ cp .env.example .env
|
||||
docker compose up -d --build
|
||||
```
|
||||
|
||||
4. 验证服务:
|
||||
4. 验证自定义推理服务:
|
||||
|
||||
```bash
|
||||
curl http://localhost:8000/health
|
||||
```
|
||||
|
||||
5. 验证 OpenAI 协议服务:
|
||||
|
||||
```bash
|
||||
curl http://localhost:8001/v1/models
|
||||
```
|
||||
|
||||
## 推理请求示例
|
||||
|
||||
```bash
|
||||
@@ -118,6 +127,22 @@ curl -X POST "http://localhost:8000/v1/generate" \
|
||||
-d "{\"prompt\":\"请用三句话介绍大模型推理优化\",\"max_tokens\":128,\"temperature\":0.7}"
|
||||
```
|
||||
|
||||
## OpenAI 协议示例(8001)
|
||||
|
||||
```bash
|
||||
curl -X POST "http://localhost:8001/v1/chat/completions" \
|
||||
-H "Content-Type: application/json" \
|
||||
-H "Authorization: Bearer ${API_KEY}" \
|
||||
-d "{\"model\":\"Qwen3.5-35B-A3B-GPTQ-Int4\",\"messages\":[{\"role\":\"user\",\"content\":\"你好,介绍一下你自己\"}],\"temperature\":0.7}"
|
||||
```
|
||||
|
||||
## OpenClaw 调用说明
|
||||
|
||||
- Base URL 使用 `http://<服务器IP>:8001/v1`
|
||||
- API Key 使用 `.env` 中 `API_KEY` 对应值
|
||||
- 模型名使用 `config.json` 中 `served_model_name`
|
||||
- 若使用工具调用,`config.json` 中应配置 `tool_call_parser` 与 `enable_auto_tool_choice`
|
||||
|
||||
## 双 AMD R9700 调优建议
|
||||
|
||||
- 首选 `TENSOR_PARALLEL_SIZE=2`
|
||||
|
||||
Reference in New Issue
Block a user