wangjiming
|
6c1bf61ff7
|
更新平台治理
|
2026-08-17 09:15:36 +08:00 |
|
wuyongtao
|
5ecca9f0bc
|
feat: 权限与日志治理完善,MinIO 独立部署与 tiktoken 离线打包适配
- 后端:强化平台/审批/资源/系统接口权限校验与操作日志,更新权限设计文档与测试用例
- 存储:新增 MinIO 独立部署适配(端口 19000/19001),外部端点与 host-gateway 互通
- 离线:打包 tiktoken cl100k_base 词表进镜像,避免无网环境联网下载
- 其他:算力节点接口微调,前端微调创建页小修,忽略 MinIO 运行时数据
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-12 15:21:42 +08:00 |
|
caoxiaozhu
|
2f64086177
|
docs(data_process): 在 __init__ 补充模块职责速查与分层说明
|
2026-08-12 14:46:56 +08:00 |
|
caoxiaozhu
|
bdaf72d58b
|
chore: 删除误存的 document_chunking.txt(macOS 压缩的 zip 残留,代码未引用)
|
2026-08-12 14:39:11 +08:00 |
|
caoxiaozhu
|
ca012893f7
|
refactor: 完整重构 data_process 模块并修复拆分遗留缺陷
将 algorithms.py / store.py 拆分为 algorithms/ 与 store/ 子包,并修复
机械拆分造成的导入与辅助函数缺失:
- algorithms/: 补全各子模块依赖与 17 个私有辅助函数、8 个常量;重写
__init__.py 移除坏的 importlib 兜底,分层导入并以局部 import 断开
text_utils<->parsers、quality<->structured_processing 循环依赖。
- store/: 补回 DataProcessStoreError / hashlib / _serialize_value /
estimate_token_count 等缺失导入,包入口导出测试与调用方依赖的私有
辅助函数。
- 删除旧单文件 algorithms.py / store.py 及重构残留(_algorithms_old、
backups、refactor 脚本、REFACTORING 文档)。
algorithms 与 store 测试套件 91 项全部通过。
|
2026-08-12 14:29:39 +08:00 |
|
wuyongtao
|
b5d2cd7935
|
feat: 新增 MinIO 对象存储与算力节点缓存预下载
- 后端新增 storage 模块(minio_store),支持 MinIO 预签名 URL 上传与对象管理
- config 新增 MinIO 及存储等待相关配置项
- 算力节点新增 /compute/cache/prepare 缓存预下载接口(带校验和原子落盘)
- 算力节点健康接口增加存储可用性探针
- SQL 迁移补充资源存储相关表结构
- Docker 新增 minio 服务与后端 minio 配置
- 补充 minio-compute-cache-plan 设计文档
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-11 16:25:18 +08:00 |
|
wangjiming
|
a12f80492d
|
Merge branch 'ft_wyt' of http://www.caoxiaozhu.com:13001/YG-Soft/YG_FT into ft_wyt
|
2026-08-11 15:45:23 +08:00 |
|
wangjiming
|
71405def14
|
新增配置模型测试按钮
|
2026-08-11 15:41:51 +08:00 |
|
caoxiaozhu
|
5f6e7523cf
|
feat: 新增外部数据源拉取与 DPO 输出格式支持
- 支持从 PostgreSQL 数据库拉取结构化数据作为训练来源
- 新增 DPO (Direct Preference Optimization) 输出类型
- 支持 chosen/rejected 字段的编辑、校验和发布
- 完善数据预处理切分逻辑和元数据管理
- 移除 OCR 扫描 PDF 功能,保持基础文本解析能力
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-11 14:17:45 +08:00 |
|
wangjiming
|
f809825a7d
|
完善部分平台治理功能,及修改看板缺陷
|
2026-08-10 11:41:16 +08:00 |
|
wuyongtao
|
75cc105ebc
|
chore: 忽略离线部署包,提交安全加固、数据库初始化与文档
- .gitignore: 忽略 docker/offline 离线部署包(镜像/运行时等大文件)
- 安全加固: 新增 compute/api/security.py 及各端安全测试,补充 docs/security-hardening.md
- 数据库: 新增完整初始化 SQL 与 docs/database-config.md
- 数据转换与评测: 修复类型检查、增强校验并补充测试
- Docker 配置与环境变量更新
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-07 09:24:35 +08:00 |
|
wangjiming
|
c64fa1cd61
|
新增数据类型转换
|
2026-08-05 16:23:00 +08:00 |
|
wuyongtao
|
ec7d8c0a3d
|
fix: 算力节点任务/GPU 统计纳入评测与推理占用,补充测试依赖
- compute_nodes() 的 current_running_jobs 纳入运行中的评测任务(eval_tasks)
与已加载的推理模型(compare_tasks 持久化状态 + 内存标记兜底),
多节点时 GPU 被评测/推理占用不再显示 0/1
- gpus() 直接按 eval_tasks / compare_tasks 派生 GPU busy/reserved 状态,
修复 gpu_id=0 时 or -1 导致匹配失败;删除评测后 GPU 不再残留 busy
- 评测不再复用 mark_inference_loaded 内存标记,GPU 占用由任务数据驱动
- requirements.txt 补充 pytest / ruff(此前仅声明在 pyproject dev 可选依赖)
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-04 18:46:53 +08:00 |
|
wuyongtao
|
0292bf5138
|
fix: 模型评测异步加载等待与多节点路由修复
- eval_runner 等待异步模型加载完成(InferenceSession.wait_until_loaded),
修复 "model load failed: unknown"
- 评测算力节点选择:优先页面选择的节点 / 模型所在节点(_select_eval_node),
多节点时不再派发到不可达节点导致连接超时
- 前端评测 GPU 选择改为节点感知(节点:GPU 复合值),透传 compute_node_id,
并检查 startEval 结果展示真实错误
- 大模型评价(judge)使用模型记录的真实 API 模型名(api_model),
避免用平台内部名调用 LLM API 导致 HTTP 400
- 新增后端节点选择与 compute wait_until_loaded 单元测试
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-04 18:21:16 +08:00 |
|
wuyongtao
|
0271942ba5
|
feat: 模型推理异步加载与对话链路修复,同步基线
模型推理全异步化改造:
- 计算节点 InferenceSession 改为后台线程异步加载模型,load 立即返回,
加载期间事件循环保持响应(/inference/status 与 /health 不阻塞)
- 后端模型加载改为异步派发 + 轮询对账器(reconcile_inference_loads),
任务状态由 starting 自动推进到 ready/error,解决多节点启动超时
(timeout of 120000ms exceeded)
- 推理删除/卸载改为任务感知 + 短超时,删除先删记录再 best-effort 卸载,
不再被不可达节点阻塞;同节点新模型替换旧任务标记失效
- 流式对话透传 task_id/node_id 路由到真正加载模型的算力节点,
useStreamChat 解析 SSE 错误帧以干净文案展示
- 对话历史按任务 id 本地持久化,退出重进可恢复;移除页脚提示文本
- 新增后端推理异步加载与计算节点异步状态机单元测试
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-04 16:59:34 +08:00 |
|
wuyongtao
|
250e060271
|
feat: 看板服务状态优化,移除前端访问统计埋点,修正列表页文案与类型
- 看板:补齐各服务模块图标,服务状态表格改为自适应行高并支持滚动
- 移除前端请求访问统计埋点及对应 audit-visit API 模块
- 平台接口:清理 service_checks 循环中未使用的路径变量
- 系统模块:导出 SystemUser 类型
- 项目/租户列表:统一“项目名称/编码 ID/租户 ID”文案,补充表格行类型断言修复
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-04 11:34:04 +08:00 |
|
wuyongtao
|
7b36bc774e
|
Merge branch 'ft_wyt' of http://www.caoxiaozhu.com:13001/YG-Soft/YG_FT into ft_wyt
|
2026-08-03 17:34:23 +08:00 |
|
wuyongtao
|
4e5c43fad5
|
feat: 评测任务元数据增强与前端展示优化
后端:
- 新增评测指标标签生成(_build_eval_metric_label/_basic_metric_labels)
- eval 任务 payload 富化(_enrich_eval_payload): 解析模型名/数据集名/维度配置, 生成 metric_label
- 任务创建时解析 trained_models/模型名, metric 回退为 metric_label
- 运行时状态刷新增加 2s 节流, 避免频繁触发
前端:
- EvalTask 类型增加 dataset_id/metric_label
- 评测列表与详情展示 metric_label 指标标签, 模型名/指标超长 tooltip 省略
- 创建页改用 getComputeGpus 过滤空闲 GPU, 移除 getSystemInfo 依赖
|
2026-08-03 17:34:21 +08:00 |
|
wangjiming
|
62a1d03eac
|
更新前端看板1
|
2026-08-03 17:24:45 +08:00 |
|
wangjiming
|
94230cad16
|
更新前端看板
|
2026-08-03 16:33:08 +08:00 |
|
wangjiming
|
0c601934a0
|
更新前端看板
|
2026-08-03 16:20:21 +08:00 |
|
wuyongtao
|
5cc306eb0a
|
fix: 推理/评测结果同步、数据集统计与算力节点管理增强
后端:
- 抽取 fetch_eval_result_content 复用函数,model_eval_detail 直接应用评测任务结果
- health 接口移除数据库依赖,返回静态指标
- 数据集: count_dataset_records JSON 感知计数; 文件统计改为从 dataset_files 聚合重算; 在线编辑记录 size/record_count/version_no; 上传同步批处理
- 算力节点: 调度支持 requested GPU 子集校验与容量计算; 新增 delete_compute_node(含活动任务保护)及 DELETE 接口; 连接池 connect_timeout
- 评测任务落库 basic_metrics/score/completed_time, failed/stopped 记录 error
评测引擎:
- _load_dataset 支持 JSON/JSONL 文件
- 新增 exact match 与文本相似度指标, 余弦相似度去掉 2 样本限制
前端:
- 算力节点列表「维护」改为「删除」(带确认弹窗), compute.ts 新增 deleteComputeNode
- 数据集上传超时调整为 120s; FineTuneTask 增加 compute_node_id; GpuInfo 状态增加 reserved
|
2026-08-03 15:49:21 +08:00 |
|
wuyongtao
|
24c77a990a
|
Merge branch 'ft_wyt' of http://www.caoxiaozhu.com:13001/YG-Soft/YG_FT into ft_wyt
# Conflicts:
# backend/app/api/v1/endpoints/platform.py
# compute/requirements.txt
|
2026-08-03 09:42:49 +08:00 |
|
wangjiming
|
15c4223f2c
|
update
|
2026-08-03 09:34:08 +08:00 |
|
caoxiaozhu
|
b975de02da
|
fix: 完善数据预处理与 JSON 上传链路
|
2026-07-30 16:54:00 +08:00 |
|
wuyongtao
|
0c39f2f5b9
|
feat: 模型评测端到端闭环 — EvalRunner引擎 + 算力节点Job执行 + 结果回写
算力节点 (compute):
- 新建 eval_runner.py: 评测执行引擎,作为subprocess运行
- 加载模型 + JSONL数据集 + 逐样本推理
- BLEU/ROUGE/Cosine基础指标计算
- LLM Judge评分(OpenAI兼容API调用)
- 结果写入eval_results.json
- adapter.py: build_command新增engine=eval分支
- main.py: 新增/json模块导入,新增/compute/files/read端点,eval job校验
后端:
- platform.py: 重写startEval提交eval job到算力节点
- 支持models表和trained_models表查找
- 已合并模型不传adapter路径
- platform_store.py: 新增update_eval_task/running_eval_tasks/apply_eval_job_result
- sync.py: poller新增eval job同步,异步读取eval_results.json回写结果
前端:
- EvalCreateView/DimensionCreateView: eval模型过滤扩展(API类型+api_url)
- EvalCreateView: GPU过滤在线节点空闲GPU
- EvalTaskSetupStep: GPU value从数组index改为gpu.id
- BasicMetricSetupStep: ROUGE方法名修正(rouge_1→rouge1)
- EvalView: 新增5秒轮询刷新
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-07-28 19:34:41 +08:00 |
|
wuyongtao
|
c7c9ed925b
|
feat: 模型推理端到端闭环 — 真实流式推理 + 释放/删除 + GPU 状态同步
后端 (platform.py + platform_store.py):
- 新增 _build_messages_payload() 转换前端格式为 OpenAI messages
- 新增 _stream_chat_proxy() SSE 流式代理到算力节点
- 新增 _unload_from_compute_node() 真正释放算力节点 GPU 显存
- 重写 model_compare_load: 从假 PID/端口改为真正调用算力节点加载模型
- 修复 model_compare_unload: 调用 _unload_from_compute_node 释放 GPU
- 修复 model_compare_delete: 先释放 GPU 再删除记录
- 修复 model_compare_stream_chat: 从 mock 改为 StreamingResponse 代理
- 修复 model_chat_local/stream: 消息格式转换 + 路径修正
- PlatformStore 新增 _inference_nodes 追踪,gpus() 同步推理占用状态
- preload/unload 端点标记/清除推理节点占用
算力节点 (compute):
- inference.py: 适配新版 LLaMA-Factory API (get_infer_args 4 返回值、ChatModel args dict、stream_chat 新签名)
- inference.py: unload() 增加 gc.collect + torch.cuda.empty_cache + synchronize 彻底释放显存
- main.py: inference/load 移除 HTTPException(500),错误以 200 正常返回
前端:
- InferenceChatView: 真实模式下走 SSE 流式推理,mock 模式保留兼容
- InferenceCreateView: 调用 preloadLocalModel + createCompare 真实创建推理任务,失败回退 mock
- InferenceListView: 「停止」改为「释放」,删除前先释放算力节点,改进错误提示
- compare.ts: 新增 streamChatReal() fetch SSE,preload 超时提升至 5 分钟
- useStreamChat.ts: send() 支持 useMock 参数,真实模式调用 streamChatReal
- GPU 选择过滤: 仅显示在线算力节点上的空闲 GPU
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-07-28 17:29:16 +08:00 |
|
wuyongtao
|
f917a025e1
|
feat: 基于 LLaMA-Factory 实现模型推理引擎
利用容器内已有的 LLaMA-Factory ChatModel (huggingface 后端) 实现真实
模型推理,无需额外安装 vLLM。
Compute 端新增:
- compute/engines/llama_factory/inference.py
InferenceSession: 模型加载/卸载/对话/流式输出
支持 base model 和 LoRA adapter,线程安全
- compute/api/main.py 新增 5 个推理端点:
POST /inference/load - 加载模型
POST /inference/unload - 卸载释放 GPU 显存
GET /inference/status - 查询会话状态
POST /inference/chat - 非流式对话
POST /inference/chat/stream - SSE 流式对话
后端新增:
- platform.py 推理代理端点(local/chat, local/chat/stream,
local/preload, local/unload, local/status, trained/preload)
- ComputeNodeClient._request 通用请求方法
- _select_first_online_node 自动选择在线节点
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-07-28 13:49:10 +08:00 |
|
wuyongtao
|
a9ab130d43
|
feat: P0 训练闭环核心功能实现
P0-1 模型路径治理:
- 新增 003_model_path_governance.sql 迁移,models 表增加 can_train 字段
- create_model/update_model 自动计算 can_train(非API+有路径=可训练)
- _compute_job_payload_from_task_node 拒绝 API 模型和无可训练路径模型
- 平台诊断规则增加 API 模型/路径缺失检测
P0-2 数据集格式校验:
- 新增 dataset_format.py,支持 Alpaca/ShareGPT/DPO/CPT 格式校验
- 训练预检时自动根据 train_type 匹配格式并校验内容字段
- llama_dataset_info 增加 DPO/CPT 格式列映射
P0-3 训练完成产物入库:
- _ensure_trained_model 使用 compute 节点返回的真实 artifacts
- 注册 per-file artifact 记录(含 size_bytes/checksum_sha256)
- trained_models 表增加 artifact_dir 字段
P0-4 失败日志拉取:
- poll_compute_jobs_once 检测到 failed/stopped 时强制拉取最后 200 行日志
- apply_compute_job 持久化失败日志片段到任务 payload
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-07-28 13:10:53 +08:00 |
|
caoxiaozhu
|
01d2e6c76a
|
feat(data-process): 完善后台生成与失败重试
|
2026-07-28 10:56:05 +08:00 |
|
caoxiaozhu
|
9025437a37
|
feat(data-process): 增加 Office 原文件预览接口
|
2026-07-27 16:12:50 +08:00 |
|
caoxiaozhu
|
f97245b814
|
feat(data-process): 增加可配置思维链生成
|
2026-07-27 14:41:38 +08:00 |
|
caoxiaozhu
|
de2e8952b5
|
feat(data-process): 支持思维链输出类型
|
2026-07-27 13:08:44 +08:00 |
|
caoxiaozhu
|
ecafb7eb13
|
fix(dataset): 展示训练任务名称
|
2026-07-27 12:44:40 +08:00 |
|
caoxiaozhu
|
bce586697b
|
fix(dataset): 统一大小与版本元数据
|
2026-07-27 12:26:09 +08:00 |
|
caoxiaozhu
|
b08a771a61
|
fix(data-process): 保留可验证的任务耗时
|
2026-07-27 11:16:48 +08:00 |
|
caoxiaozhu
|
8caaaa5bbc
|
fix(data-process): 恢复提前中断的重新生成任务
|
2026-07-27 11:07:18 +08:00 |
|
caoxiaozhu
|
53014bb381
|
fix(data-process): 延迟重新生成破坏性变更
|
2026-07-27 10:43:42 +08:00 |
|
caoxiaozhu
|
b14b2ecf22
|
fix(data-process): 修正任务详情数据契约
|
2026-07-27 10:03:46 +08:00 |
|
caoxiaozhu
|
895983ac20
|
feat(data-process): 返回任务文档数量
|
2026-07-27 09:50:19 +08:00 |
|
caoxiaozhu
|
e4ea1f168c
|
fix(data-process): 保留重新生成前的已发布数据集
|
2026-07-27 09:39:19 +08:00 |
|
caoxiaozhu
|
9428c6b785
|
feat(data-process): 支持单项生成五十条数据
|
2026-07-27 09:11:51 +08:00 |
|
caoxiaozhu
|
396d3f6f47
|
feat(data-process): 支持任务重新生成
|
2026-07-25 22:40:55 +08:00 |
|
caoxiaozhu
|
07e2999323
|
fix(data-process): 修复三数据集发布参数错误
|
2026-07-25 18:19:37 +08:00 |
|
caoxiaozhu
|
ea08478a37
|
feat(data-process): 接入三种文档切分引擎
|
2026-07-25 18:00:21 +08:00 |
|
caoxiaozhu
|
e9a121cfeb
|
fix(data-process): 发布三个独立切分数据集
|
2026-07-25 17:04:14 +08:00 |
|
caoxiaozhu
|
9cb77c251a
|
fix(data-process): 发布精确三路数据切分
|
2026-07-24 20:43:47 +08:00 |
|
caoxiaozhu
|
994ec6644a
|
fix(data-process): 修正详情统计字段契约
|
2026-07-24 16:28:47 +08:00 |
|
caoxiaozhu
|
3266a6fc09
|
feat(data-process): 清理PDF文档级噪声
|
2026-07-24 15:05:39 +08:00 |
|
caoxiaozhu
|
93373bc61f
|
fix(data-process): 合并文档结构短切片
|
2026-07-24 14:36:11 +08:00 |
|