wuyongtao
|
5cc306eb0a
|
fix: 推理/评测结果同步、数据集统计与算力节点管理增强
后端:
- 抽取 fetch_eval_result_content 复用函数,model_eval_detail 直接应用评测任务结果
- health 接口移除数据库依赖,返回静态指标
- 数据集: count_dataset_records JSON 感知计数; 文件统计改为从 dataset_files 聚合重算; 在线编辑记录 size/record_count/version_no; 上传同步批处理
- 算力节点: 调度支持 requested GPU 子集校验与容量计算; 新增 delete_compute_node(含活动任务保护)及 DELETE 接口; 连接池 connect_timeout
- 评测任务落库 basic_metrics/score/completed_time, failed/stopped 记录 error
评测引擎:
- _load_dataset 支持 JSON/JSONL 文件
- 新增 exact match 与文本相似度指标, 余弦相似度去掉 2 样本限制
前端:
- 算力节点列表「维护」改为「删除」(带确认弹窗), compute.ts 新增 deleteComputeNode
- 数据集上传超时调整为 120s; FineTuneTask 增加 compute_node_id; GpuInfo 状态增加 reserved
|
2026-08-03 15:49:21 +08:00 |
|
wuyongtao
|
f917a025e1
|
feat: 基于 LLaMA-Factory 实现模型推理引擎
利用容器内已有的 LLaMA-Factory ChatModel (huggingface 后端) 实现真实
模型推理,无需额外安装 vLLM。
Compute 端新增:
- compute/engines/llama_factory/inference.py
InferenceSession: 模型加载/卸载/对话/流式输出
支持 base model 和 LoRA adapter,线程安全
- compute/api/main.py 新增 5 个推理端点:
POST /inference/load - 加载模型
POST /inference/unload - 卸载释放 GPU 显存
GET /inference/status - 查询会话状态
POST /inference/chat - 非流式对话
POST /inference/chat/stream - SSE 流式对话
后端新增:
- platform.py 推理代理端点(local/chat, local/chat/stream,
local/preload, local/unload, local/status, trained/preload)
- ComputeNodeClient._request 通用请求方法
- _select_first_online_node 自动选择在线节点
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-07-28 13:49:10 +08:00 |
|