feat: 重构 Docker 配置结构,添加 compute 模块及新增文档
- 将 Dockerfile 和 docker-compose.yml 迁移至 docker/ 目录下统一管理 - 新增 compute 计算模块(API 入口、依赖配置) - 新增 docker/app 和 docker/compute 部署配置 - 新增 demo-development-plan.md 演示开发计划文档 - 更新后端 API 设计、部署计划、架构需求等文档 - 更新 postgres 数据库 schema Co-Authored-By: Claude <noreply@anthropic.com>
This commit is contained in:
@@ -156,7 +156,7 @@
|
||||
- API Key 管理。
|
||||
- OpenAPI 文档。
|
||||
- 请求限流。
|
||||
- Webhook 回调。
|
||||
- Webhook 回调作为外部系统集成的可选能力,不作为算力状态同步默认方案。
|
||||
- 外部系统发起训练、评测、推理。
|
||||
|
||||
### 1.11 企业统一身份认证
|
||||
@@ -487,6 +487,9 @@ YG_FT/
|
||||
- 任务队列。
|
||||
- Agent 健康状态。
|
||||
- 租户/项目配额。
|
||||
- 算力节点新增、编辑、连接测试、启用、禁用、维护模式。
|
||||
- 节点权重、标签、训练引擎版本和本地资源副本。
|
||||
- 自动调度和手动指定节点入口。
|
||||
|
||||
联调接口:
|
||||
|
||||
@@ -567,16 +570,27 @@ YG_FT/
|
||||
开发内容:
|
||||
|
||||
- 算力平台客户端。
|
||||
- 算力节点管理:地址、File Gateway、权重、标签、启用状态、维护状态。
|
||||
- 自动/手动调度策略。
|
||||
- 调度前检查模型/数据集在目标节点的资源副本。
|
||||
- 缺失资源时创建同步任务,通过目标节点 File Gateway 写入本地磁盘。
|
||||
- 创建 compute job。
|
||||
- 查询状态和日志。
|
||||
- 状态回调验签。
|
||||
- 应用侧定时轮询 Compute API,同步任务状态、日志摘要和产物索引。
|
||||
- 任务状态映射。
|
||||
|
||||
交付接口:
|
||||
|
||||
- `GET /api/compute/gpus`
|
||||
- `GET /api/compute/queue`
|
||||
- `POST /api/internal/compute-callbacks/jobs`
|
||||
- `GET/POST/PUT /api/compute/nodes`
|
||||
- `POST /api/compute/nodes/{id}/test-connection`
|
||||
- `POST /api/compute/nodes/{id}/enable`
|
||||
- `POST /api/compute/nodes/{id}/disable`
|
||||
- `POST /api/compute/nodes/{id}/drain`
|
||||
- `GET /api/compute/nodes/{id}/replicas`
|
||||
- `POST /api/internal/compute-sync/jobs/poll`
|
||||
- `POST /api/internal/compute-sync/resources`
|
||||
|
||||
#### Fine Tune 模块
|
||||
|
||||
@@ -660,7 +674,9 @@ YG_FT/
|
||||
- 校验服务 token。
|
||||
- 调用 Agent。
|
||||
- 聚合状态。
|
||||
- 回调应用平台。
|
||||
- 提供任务状态查询接口,供应用平台定时轮询。
|
||||
- 每个单机多 GPU 算力节点都部署一套 Compute API,不依赖其他算力节点。
|
||||
- 暴露节点健康、GPU、训练引擎、资源副本和文件网关状态。
|
||||
|
||||
### 7.2 Compute Agent
|
||||
|
||||
@@ -735,9 +751,12 @@ YG_FT/
|
||||
| `quota_usage` | 配额使用 |
|
||||
| `storage_nodes` | 存储节点 |
|
||||
| `compute_nodes` | 算力节点 |
|
||||
| `compute_node_engines` | 算力节点训练引擎能力 |
|
||||
| `gpu_devices` | GPU 设备 |
|
||||
| `gpu_allocations` | GPU 分配记录 |
|
||||
| `compute_jobs` | 算力任务 |
|
||||
| `resource_replicas` | 数据集/模型/产物在算力节点的本地副本 |
|
||||
| `resource_sync_jobs` | 应用平台编排的资源同步任务 |
|
||||
| `training_engines` | 训练引擎 |
|
||||
| `retention_policies` | 保留策略 |
|
||||
| `cleanup_jobs` | 清理任务 |
|
||||
@@ -782,12 +801,14 @@ YG_FT/
|
||||
- `file-gateway`
|
||||
- `llama-factory-env`
|
||||
|
||||
多算力节点阶段,每台单机多 GPU 服务器都部署以上组件和宿主机挂载的 LLaMA-Factory。算力节点之间默认不互相访问,由应用平台统一调度和同步资源。
|
||||
|
||||
配置:
|
||||
|
||||
- `COMPUTE_NODE_ID`
|
||||
- `SERVICE_TOKEN`
|
||||
- `APP_CALLBACK_URL`
|
||||
- `DATA_ROOT=/data/ft-platform`
|
||||
- `ENABLE_APP_CALLBACK=false`
|
||||
- `DATA_ROOT=/data/yg-ft`
|
||||
- `LLAMA_FACTORY_PATH`
|
||||
- `PYTHON_ENV_PATH`
|
||||
- `GPU_VISIBLE_DEVICES`
|
||||
@@ -798,7 +819,7 @@ YG_FT/
|
||||
|
||||
- 前端只访问应用平台。
|
||||
- 应用平台可访问算力平台内部 API。
|
||||
- 算力平台可回调应用平台 internal callback。
|
||||
- 第一阶段只开通应用平台主动访问算力平台内部 API,状态同步采用应用侧轮询。
|
||||
- 算力平台不直接暴露给公网。
|
||||
- 文件下载通过应用平台签发令牌。
|
||||
|
||||
@@ -939,9 +960,9 @@ YG_FT/
|
||||
|
||||
### 算力组
|
||||
|
||||
- CE-A:Compute API、Agent、GPU 调度。
|
||||
- CE-A:Compute API、Agent、GPU 调度、多节点健康检查。
|
||||
- CE-B:LLaMA-Factory Adapter、日志解析、产物管理。
|
||||
- CE-C:File Gateway、本地磁盘、离线导入。
|
||||
- CE-C:File Gateway、本地磁盘、离线导入、资源副本同步。
|
||||
|
||||
### 数据库/部署组
|
||||
|
||||
@@ -954,7 +975,8 @@ YG_FT/
|
||||
| --- | --- | --- |
|
||||
| M1 基础治理 | 第 1-2 周 | 登录、用户、租户、项目、权限 |
|
||||
| M2 资源管理 | 第 3-4 周 | 模型、数据集、文件网关、离线导入 |
|
||||
| M3 训练主链路 | 第 5-7 周 | GPU 调度、LLaMA-Factory 训练、日志指标、产物 |
|
||||
| M3 训练主链路 | 第 5-7 周 | GPU 调度、LLaMA-Factory 训练、日志指标、产物、资源副本检查 |
|
||||
| M3.5 多节点预留 | 第 7-8 周 | compute_nodes 管理、节点权重/标签、自动/手动调度、资源同步任务 |
|
||||
| M4 数据处理和评测 | 第 8-9 周 | 数据处理、质量评分、自动评测 |
|
||||
| M5 推理发布 | 第 10-11 周 | 推理服务、模型对比、生产发布审批 |
|
||||
| M6 企业治理收口 | 第 12 周 | 审批、审计、配额、清理、部署文档 |
|
||||
@@ -967,7 +989,8 @@ YG_FT/
|
||||
- 项目成员只能访问授权项目资源。
|
||||
- 模型和数据集支持资源级授权。
|
||||
- 上传数据集后可预览、编辑版本、用于训练。
|
||||
- 训练任务可指定 GPU 并成功运行。
|
||||
- 训练任务可自动调度节点/GPU,也可由管理员手动指定节点/GPU 并成功运行。
|
||||
- 调度前可识别目标节点是否已有数据集和模型副本,缺失时能创建同步任务。
|
||||
- 训练日志和指标实时可见。
|
||||
- 训练产物可登记、合并、发布测试服务。
|
||||
- 评测任务可生成样本级结果。
|
||||
@@ -1078,7 +1101,7 @@ YG_FT/
|
||||
| --- | --- | --- | --- | --- | --- |
|
||||
| 审批中心 | `/approvals`、`/approvals/pending`、`/approvals/mine`、`/approvals/:id` | 审批列表、详情、通过/驳回/撤回 | `/api/approvals` 系列 | `approval_instances`、`approval_steps` | 用户、项目 |
|
||||
| 审批模板 | `/approval-settings` | 动作策略、审批人规则、超时配置 | `/api/approval-templates` 系列 | `approval_templates` | 租户/项目 |
|
||||
| 算力资源中心 | `/compute`、`/compute/gpus`、`/compute/queue`、`/compute/nodes` | GPU 卡片、节点状态、队列、优先级 | `/api/compute/*`、`/compute/*` 内部接口 | `compute_nodes`、`gpu_devices`、`compute_jobs`、`gpu_allocations` | Compute API/Agent |
|
||||
| 算力资源中心 | `/compute`、`/compute/gpus`、`/compute/queue`、`/compute/nodes` | GPU 卡片、节点状态、队列、优先级、节点新增/编辑、连接测试、启用/禁用、维护模式、节点权重/标签、本地资源副本 | `/api/compute/*`、`/compute/*` 内部接口 | `compute_nodes`、`compute_node_engines`、`gpu_devices`、`compute_jobs`、`gpu_allocations`、`resource_replicas`、`resource_sync_jobs` | Compute API/Agent/File Gateway |
|
||||
| 存储管理 | `/storage` | 磁盘占用、大文件、临时文件、checkpoint 清理 | `GET /api/quotas/usage`、`GET/PUT /api/retention-policies` | `storage_nodes`、`storage_objects`、`cleanup_jobs`、`retention_policies` | 文件网关 |
|
||||
| 审计中心 | `/audit-logs`、`/login-logs`、`/download-logs` | 筛选、详情、导出 | `GET /api/audit-logs`、`GET /api/login-logs`、`GET /api/download-logs` | `audit_logs`、`login_sessions` | 审计中间件 |
|
||||
|
||||
|
||||
Reference in New Issue
Block a user