This commit is contained in:
2026-03-29 05:22:25 +08:00
parent 6790945334
commit 4db5de796a
5 changed files with 129 additions and 2 deletions
+26 -1
View File
@@ -7,6 +7,7 @@
- 提供可容器化部署的模型推理 API
- 使用 vLLM 在双 GPU 上进行张量并行推理
- 提供健康检查、鉴权和参数化配置能力
- 暴露 `8001` OpenAI 标准协议接口,兼容 OpenClaw 调用
## 目录结构
@@ -57,6 +58,8 @@
- `MODEL_CONFIG_FILE`:模型配置文件路径,默认 `config.json`
- `MODEL_KEY`:要启动的模型键,留空时使用 `config.json` 中 `default_model`
- `MODEL_NAME`:兜底模型名(仅在不使用配置文件时生效)
- `OPENAI_HOST`:OpenAI 协议服务监听地址,默认 `0.0.0.0`
- `OPENAI_PORT`:OpenAI 协议服务监听端口,默认 `8001`
- `TENSOR_PARALLEL_SIZE`:张量并行数,双卡建议为 `2`
- `GPU_MEMORY_UTILIZATION`:单卡显存利用率,建议 `0.90~0.95`
- `MAX_MODEL_LEN`:模型最大上下文长度
@@ -104,12 +107,18 @@ cp .env.example .env
docker compose up -d --build
```
4. 验证服务:
4. 验证自定义推理服务:
```bash
curl http://localhost:8000/health
```
5. 验证 OpenAI 协议服务:
```bash
curl http://localhost:8001/v1/models
```
## 推理请求示例
```bash
@@ -118,6 +127,22 @@ curl -X POST "http://localhost:8000/v1/generate" \
-d "{\"prompt\":\"请用三句话介绍大模型推理优化\",\"max_tokens\":128,\"temperature\":0.7}"
```
## OpenAI 协议示例(8001)
```bash
curl -X POST "http://localhost:8001/v1/chat/completions" \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${API_KEY}" \
-d "{\"model\":\"Qwen3.5-35B-A3B-GPTQ-Int4\",\"messages\":[{\"role\":\"user\",\"content\":\"你好,介绍一下你自己\"}],\"temperature\":0.7}"
```
## OpenClaw 调用说明
- Base URL 使用 `http://<服务器IP>:8001/v1`
- API Key 使用 `.env` 中 `API_KEY` 对应值
- 模型名使用 `config.json` 中 `served_model_name`
- 若使用工具调用,`config.json` 中应配置 `tool_call_parser` 与 `enable_auto_tool_choice`
## 双 AMD R9700 调优建议
- 首选 `TENSOR_PARALLEL_SIZE=2`