Files
YG_FT/backend
wuyongtao 0292bf5138 fix: 模型评测异步加载等待与多节点路由修复
- eval_runner 等待异步模型加载完成(InferenceSession.wait_until_loaded),
  修复 "model load failed: unknown"
- 评测算力节点选择:优先页面选择的节点 / 模型所在节点(_select_eval_node),
  多节点时不再派发到不可达节点导致连接超时
- 前端评测 GPU 选择改为节点感知(节点:GPU 复合值),透传 compute_node_id,
  并检查 startEval 结果展示真实错误
- 大模型评价(judge)使用模型记录的真实 API 模型名(api_model),
  避免用平台内部名调用 LLM API 导致 HTTP 400
- 新增后端节点选择与 compute wait_until_loaded 单元测试

Co-Authored-By: Claude <noreply@anthropic.com>
2026-08-04 18:21:16 +08:00
..
2026-08-03 16:20:21 +08:00

Backend Service

后端工程使用 FastAPI定位为模型微调平台的应用平台服务负责用户中心、多租户、权限隔离、项目、数据集、模型、训练任务、审批、审计和算力平台编排。

目录结构

backend/
  app/
    main.py                  # FastAPI 应用入口
    api/v1/                  # 对前端暴露的 接口路由
    core/                    # 配置、日志、中间件、权限等基础能力
    db/                      # 数据库连接、迁移集成、事务工具
    modules/                 # 业务模块
      auth/
      tenant/
      project/
      model/
      dataset/
      data_process/
      fine_tune/
      eval/
      inference/
      approval/
      audit/
      compute_gateway/
      file_gateway/
      engine_registry/
      retention/
      system/
    schemas/                 # Pydantic 入参/出参模型
    services/                # 跨模块应用服务
    workers/                 # 后台任务入口
  requirements.txt           # 后端第三方依赖
  logs/                      # 本地开发日志目录,生产环境建议挂载到独立日志盘

本地启动

cd backend
python -m venv .venv
.venv\Scripts\activate
pip install -r requirements.txt
uvicorn app.main:app --reload

健康检查:

GET /modelTF/health

日志

日志模块位于 app/core/logging.py,使用说明见 ../docs/backend-logging.md

默认日志文件:

logs/backend-YYYY-MM-DD.log
logs/error-YYYY-MM-DD.log

文件日志为 JSON Lines 格式,单个文件不超过 20MB只保存最近 10 天,错误日志按 ERROR 级别独立拆分,便于 ELK/日志平台采集。