Files
YG_FT/backend
wuyongtao c7c9ed925b feat: 模型推理端到端闭环 — 真实流式推理 + 释放/删除 + GPU 状态同步
后端 (platform.py + platform_store.py):
- 新增 _build_messages_payload() 转换前端格式为 OpenAI messages
- 新增 _stream_chat_proxy() SSE 流式代理到算力节点
- 新增 _unload_from_compute_node() 真正释放算力节点 GPU 显存
- 重写 model_compare_load: 从假 PID/端口改为真正调用算力节点加载模型
- 修复 model_compare_unload: 调用 _unload_from_compute_node 释放 GPU
- 修复 model_compare_delete: 先释放 GPU 再删除记录
- 修复 model_compare_stream_chat: 从 mock 改为 StreamingResponse 代理
- 修复 model_chat_local/stream: 消息格式转换 + 路径修正
- PlatformStore 新增 _inference_nodes 追踪,gpus() 同步推理占用状态
- preload/unload 端点标记/清除推理节点占用

算力节点 (compute):
- inference.py: 适配新版 LLaMA-Factory API (get_infer_args 4 返回值、ChatModel args dict、stream_chat 新签名)
- inference.py: unload() 增加 gc.collect + torch.cuda.empty_cache + synchronize 彻底释放显存
- main.py: inference/load 移除 HTTPException(500),错误以 200 正常返回

前端:
- InferenceChatView: 真实模式下走 SSE 流式推理,mock 模式保留兼容
- InferenceCreateView: 调用 preloadLocalModel + createCompare 真实创建推理任务,失败回退 mock
- InferenceListView: 「停止」改为「释放」,删除前先释放算力节点,改进错误提示
- compare.ts: 新增 streamChatReal() fetch SSE,preload 超时提升至 5 分钟
- useStreamChat.ts: send() 支持 useMock 参数,真实模式调用 streamChatReal
- GPU 选择过滤: 仅显示在线算力节点上的空闲 GPU

Co-Authored-By: Claude <noreply@anthropic.com>
2026-07-28 17:29:16 +08:00
..

Backend Service

后端工程使用 FastAPI定位为模型微调平台的应用平台服务负责用户中心、多租户、权限隔离、项目、数据集、模型、训练任务、审批、审计和算力平台编排。

目录结构

backend/
  app/
    main.py                  # FastAPI 应用入口
    api/v1/                  # 对前端暴露的 接口路由
    core/                    # 配置、日志、中间件、权限等基础能力
    db/                      # 数据库连接、迁移集成、事务工具
    modules/                 # 业务模块
      auth/
      tenant/
      project/
      model/
      dataset/
      data_process/
      fine_tune/
      eval/
      inference/
      approval/
      audit/
      compute_gateway/
      file_gateway/
      engine_registry/
      retention/
      system/
    schemas/                 # Pydantic 入参/出参模型
    services/                # 跨模块应用服务
    workers/                 # 后台任务入口
  requirements.txt           # 后端第三方依赖
  logs/                      # 本地开发日志目录,生产环境建议挂载到独立日志盘

本地启动

cd backend
python -m venv .venv
.venv\Scripts\activate
pip install -r requirements.txt
uvicorn app.main:app --reload

健康检查:

GET /modelTF/health

日志

日志模块位于 app/core/logging.py,使用说明见 ../docs/backend-logging.md

默认日志文件:

logs/backend-YYYY-MM-DD.log
logs/error-YYYY-MM-DD.log

文件日志为 JSON Lines 格式,单个文件不超过 20MB只保存最近 10 天,错误日志按 ERROR 级别独立拆分,便于 ELK/日志平台采集。