wuyongtao
|
93449b7f0e
|
fix(frontend): 修复操作日志与数据转换类型错误,修正普通用户角色取值
- OperationLogView: showDetail 调用补充 OperationLog 类型断言
- DataConvertView: beforeUpload 参数类型改为 UploadRawFile 并直接读取 file.type
- UserCreateView: 普通用户角色值 user 修正为 operator
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-19 11:33:45 +08:00 |
|
wuyongtao
|
9379f93633
|
feat: 推理与评测支持多卡 GPU 选择,训练任务实时 GPU 监控
- 新增 GPU 选择归一化 helper,统一前端各形态的选择(gpu_indices/gpus/gpu_id)
- 评测与推理支持同一节点内多卡选择,校验所选 GPU 空闲后再派发
- 新增 /fine-tune/{id}/gpu-status 接口,训练日志页展示实时 GPU 指标
- 算力节点推理加载支持 CUDA_VISIBLE_DEVICES 多卡可见,nvidia-smi 进程级监控
- GPU 占用跟踪细化为按卡记录,覆盖评测任务、推理模型与对比任务
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-19 11:12:17 +08:00 |
|
wangjiming
|
c3e96ae61b
|
Merge branch 'ft_wyt' of http://www.caoxiaozhu.com:13001/YG-Soft/YG_FT into ft_wyt
|
2026-08-19 10:33:06 +08:00 |
|
wangjiming
|
b254fa0985
|
修复普通用户对模型训练的权限操作
|
2026-08-19 10:32:58 +08:00 |
|
caoxiaozhu
|
f3625f994c
|
fix(frontend): 表格页画布允许收缩,修复分页条被裁掉
内容自然高度超出视口时,画布 flex 不收缩导致分页条被裁掉且无滚动
条可及;为 .data-table-page 的画布补充 flex: 1 1 auto 与 min-height: 0。
|
2026-08-18 15:49:00 +08:00 |
|
caoxiaozhu
|
78fb894307
|
feat(data_process): 优化问题生成提示语,提升问题自然度
- 系统提示语注入问题风格规则:像真实用户自然提问、避免"请描述/
请说明/根据文档"等模板化开头、多条问题交替句式,并附正反示例;
服务端注入对存量任务即时生效。
- 未配置提示语时的后端兜底从一句话充实为与前端同信息量的完整默认。
- 前端标准/思维链/DPO 三套内置默认提示语新增"问题表述自然"要求,
旧版归档为 _4 常量并注册进 isBuiltInGenerationPrompt 迁移映射,
自定义提示语不受影响。
- 新增兜底提示语专项测试与风格规则断言,生成测试 32/32 通过。
|
2026-08-18 15:49:00 +08:00 |
|
caoxiaozhu
|
91b4ae2287
|
feat(data_process): 显式关闭 docling OCR 并拒绝无文本层 PDF
- docling 转换器通过 PdfPipelineOptions 显式设置 do_ocr=False,
混合 PDF 的图片页不再产出 OCR 文字;不提供重新开启 OCR 的参数。
- 无文本层 PDF 的错误文案改为"扫描版或图片型 PDF 不支持",
上传阶段整批拒绝,保留混合 PDF 的可处理判定。
- 新增 test_layout_converter_disables_ocr 守护开关状态,
同步设计文档与 disable-ocr 实施计划/设计说明。
|
2026-08-18 15:49:00 +08:00 |
|
caoxiaozhu
|
2f48934e66
|
fix(data_process): 修复 tiktoken 加载器的变量作用域错误
函数内部的 import tiktoken.core 会把 tiktoken 变成局部变量,导致
tiktoken.get_encoding 在联网下载前就抛 UnboundLocalError,被 except
吞掉后联网与本地缓存两条路径全部失效。移除该内部 import(模块顶部
已引入 tiktoken),切分测试全部通过,编码器成功下载并缓存到
~/.cache/tiktoken,此后离线环境也可正常加载。
|
2026-08-18 15:49:00 +08:00 |
|
wangjiming
|
fed5694796
|
Merge branch 'ft_wyt' of http://www.caoxiaozhu.com:13001/YG-Soft/YG_FT into ft_wyt
|
2026-08-18 14:49:34 +08:00 |
|
wangjiming
|
04c3c1412c
|
修改普通用户的数据类型转换在数据集管理看不见的问题
|
2026-08-18 14:49:12 +08:00 |
|
wuyongtao
|
2adf78a6ed
|
feat: 数据集下载鉴权、MinIO 发布与数据库兼容增强
- 数据集下载接口鉴权:单文件直接返回、多文件打包 ZIP,前端统一走请求客户端携带 Token
- 预检/同步支持 MinIO 对象补建与资源副本记录,兼容接入 MinIO 前的历史数据集
- create_dataset 增加名称重复校验,软删记录释放名称并保留墓碑
- 数据处理发布结果支持写入 MinIO storage_objects 并关联 dataset_file
- 数据存储根目录支持 YG_FT_DATA_ROOT 环境变量
- SQL 迁移兼容旧版 approval_steps / retention_policies / data_process_results
- 训练日志图表按曲线独立过滤缺失采样点
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-18 14:45:16 +08:00 |
|
wangjiming
|
4e27b98a84
|
修改用户设置的新增用户的权限点击操作
|
2026-08-17 16:04:04 +08:00 |
|
wangjiming
|
6c1bf61ff7
|
更新平台治理
|
2026-08-17 09:15:36 +08:00 |
|
wuyongtao
|
de9c8e4ffe
|
docs: 精简 README 与 docker 部署说明,归档 20260812 文档快照
- 重写根 README 为架构、端口、启动速览,替代原详细开发指南
- 重写 docker/README.md 聚焦跨服务器部署边界与数据安全
- 新增平台测试用例文档,归档 docs/20260812 快照副本
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-12 15:38:34 +08:00 |
|
wuyongtao
|
5ecca9f0bc
|
feat: 权限与日志治理完善,MinIO 独立部署与 tiktoken 离线打包适配
- 后端:强化平台/审批/资源/系统接口权限校验与操作日志,更新权限设计文档与测试用例
- 存储:新增 MinIO 独立部署适配(端口 19000/19001),外部端点与 host-gateway 互通
- 离线:打包 tiktoken cl100k_base 词表进镜像,避免无网环境联网下载
- 其他:算力节点接口微调,前端微调创建页小修,忽略 MinIO 运行时数据
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-12 15:21:42 +08:00 |
|
caoxiaozhu
|
2f64086177
|
docs(data_process): 在 __init__ 补充模块职责速查与分层说明
|
2026-08-12 14:46:56 +08:00 |
|
caoxiaozhu
|
bdaf72d58b
|
chore: 删除误存的 document_chunking.txt(macOS 压缩的 zip 残留,代码未引用)
|
2026-08-12 14:39:11 +08:00 |
|
caoxiaozhu
|
ca012893f7
|
refactor: 完整重构 data_process 模块并修复拆分遗留缺陷
将 algorithms.py / store.py 拆分为 algorithms/ 与 store/ 子包,并修复
机械拆分造成的导入与辅助函数缺失:
- algorithms/: 补全各子模块依赖与 17 个私有辅助函数、8 个常量;重写
__init__.py 移除坏的 importlib 兜底,分层导入并以局部 import 断开
text_utils<->parsers、quality<->structured_processing 循环依赖。
- store/: 补回 DataProcessStoreError / hashlib / _serialize_value /
estimate_token_count 等缺失导入,包入口导出测试与调用方依赖的私有
辅助函数。
- 删除旧单文件 algorithms.py / store.py 及重构残留(_algorithms_old、
backups、refactor 脚本、REFACTORING 文档)。
algorithms 与 store 测试套件 91 项全部通过。
|
2026-08-12 14:29:39 +08:00 |
|
wuyongtao
|
ae39c45a73
|
feat: 前端离线部署适配与在线模型测试延迟展示
- 移除 index.html 中 Google Fonts 外链,适配离线部署环境
- 侧边栏用户头像改为显示姓名首字母,去掉 picsum 占位图外链
- 在线模型测试补充 latency_ms 延迟字段展示
- api_key 为空时传空字符串避免校验报错
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-11 16:34:06 +08:00 |
|
wuyongtao
|
b5d2cd7935
|
feat: 新增 MinIO 对象存储与算力节点缓存预下载
- 后端新增 storage 模块(minio_store),支持 MinIO 预签名 URL 上传与对象管理
- config 新增 MinIO 及存储等待相关配置项
- 算力节点新增 /compute/cache/prepare 缓存预下载接口(带校验和原子落盘)
- 算力节点健康接口增加存储可用性探针
- SQL 迁移补充资源存储相关表结构
- Docker 新增 minio 服务与后端 minio 配置
- 补充 minio-compute-cache-plan 设计文档
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-11 16:25:18 +08:00 |
|
wangjiming
|
a12f80492d
|
Merge branch 'ft_wyt' of http://www.caoxiaozhu.com:13001/YG-Soft/YG_FT into ft_wyt
|
2026-08-11 15:45:23 +08:00 |
|
wangjiming
|
71405def14
|
新增配置模型测试按钮
|
2026-08-11 15:41:51 +08:00 |
|
caoxiaozhu
|
5f6e7523cf
|
feat: 新增外部数据源拉取与 DPO 输出格式支持
- 支持从 PostgreSQL 数据库拉取结构化数据作为训练来源
- 新增 DPO (Direct Preference Optimization) 输出类型
- 支持 chosen/rejected 字段的编辑、校验和发布
- 完善数据预处理切分逻辑和元数据管理
- 移除 OCR 扫描 PDF 功能,保持基础文本解析能力
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-11 14:17:45 +08:00 |
|
wangjiming
|
f809825a7d
|
完善部分平台治理功能,及修改看板缺陷
|
2026-08-10 11:41:16 +08:00 |
|
wuyongtao
|
75cc105ebc
|
chore: 忽略离线部署包,提交安全加固、数据库初始化与文档
- .gitignore: 忽略 docker/offline 离线部署包(镜像/运行时等大文件)
- 安全加固: 新增 compute/api/security.py 及各端安全测试,补充 docs/security-hardening.md
- 数据库: 新增完整初始化 SQL 与 docs/database-config.md
- 数据转换与评测: 修复类型检查、增强校验并补充测试
- Docker 配置与环境变量更新
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-07 09:24:35 +08:00 |
|
wuyongtao
|
e397bcc2ca
|
fix: 修复数据转换页面类型检查错误
- statusTag 返回类型改用 TagProps['type'],修复 el-tag type 属性 TS 报错
- handleDelete 参数加 DataConvertTask 类型断言,修复 DefaultRow 类型不匹配
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-05 16:47:53 +08:00 |
|
wangjiming
|
c64fa1cd61
|
新增数据类型转换
|
2026-08-05 16:23:00 +08:00 |
|
wangjiming
|
b5c6557341
|
Merge branch 'ft_wyt' of http://www.caoxiaozhu.com:13001/YG-Soft/YG_FT into ft_wyt
|
2026-08-05 08:34:55 +08:00 |
|
wuyongtao
|
ec7d8c0a3d
|
fix: 算力节点任务/GPU 统计纳入评测与推理占用,补充测试依赖
- compute_nodes() 的 current_running_jobs 纳入运行中的评测任务(eval_tasks)
与已加载的推理模型(compare_tasks 持久化状态 + 内存标记兜底),
多节点时 GPU 被评测/推理占用不再显示 0/1
- gpus() 直接按 eval_tasks / compare_tasks 派生 GPU busy/reserved 状态,
修复 gpu_id=0 时 or -1 导致匹配失败;删除评测后 GPU 不再残留 busy
- 评测不再复用 mark_inference_loaded 内存标记,GPU 占用由任务数据驱动
- requirements.txt 补充 pytest / ruff(此前仅声明在 pyproject dev 可选依赖)
Co-Authored-By: Claude <noreply@anthropic.com>
baseline/ft_wyt-20260804
|
2026-08-04 18:46:53 +08:00 |
|
wuyongtao
|
0292bf5138
|
fix: 模型评测异步加载等待与多节点路由修复
- eval_runner 等待异步模型加载完成(InferenceSession.wait_until_loaded),
修复 "model load failed: unknown"
- 评测算力节点选择:优先页面选择的节点 / 模型所在节点(_select_eval_node),
多节点时不再派发到不可达节点导致连接超时
- 前端评测 GPU 选择改为节点感知(节点:GPU 复合值),透传 compute_node_id,
并检查 startEval 结果展示真实错误
- 大模型评价(judge)使用模型记录的真实 API 模型名(api_model),
避免用平台内部名调用 LLM API 导致 HTTP 400
- 新增后端节点选择与 compute wait_until_loaded 单元测试
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-04 18:21:16 +08:00 |
|
wangjiming
|
7f93ed6d09
|
feat: 更新 request.ts
|
2026-08-04 17:18:50 +08:00 |
|
wangjiming
|
5ec950cc9f
|
feat: 更新 request.ts
|
2026-08-04 17:02:57 +08:00 |
|
wuyongtao
|
0271942ba5
|
feat: 模型推理异步加载与对话链路修复,同步基线
模型推理全异步化改造:
- 计算节点 InferenceSession 改为后台线程异步加载模型,load 立即返回,
加载期间事件循环保持响应(/inference/status 与 /health 不阻塞)
- 后端模型加载改为异步派发 + 轮询对账器(reconcile_inference_loads),
任务状态由 starting 自动推进到 ready/error,解决多节点启动超时
(timeout of 120000ms exceeded)
- 推理删除/卸载改为任务感知 + 短超时,删除先删记录再 best-effort 卸载,
不再被不可达节点阻塞;同节点新模型替换旧任务标记失效
- 流式对话透传 task_id/node_id 路由到真正加载模型的算力节点,
useStreamChat 解析 SSE 错误帧以干净文案展示
- 对话历史按任务 id 本地持久化,退出重进可恢复;移除页脚提示文本
- 新增后端推理异步加载与计算节点异步状态机单元测试
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-04 16:59:34 +08:00 |
|
wuyongtao
|
250e060271
|
feat: 看板服务状态优化,移除前端访问统计埋点,修正列表页文案与类型
- 看板:补齐各服务模块图标,服务状态表格改为自适应行高并支持滚动
- 移除前端请求访问统计埋点及对应 audit-visit API 模块
- 平台接口:清理 service_checks 循环中未使用的路径变量
- 系统模块:导出 SystemUser 类型
- 项目/租户列表:统一“项目名称/编码 ID/租户 ID”文案,补充表格行类型断言修复
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-08-04 11:34:04 +08:00 |
|
wuyongtao
|
7b36bc774e
|
Merge branch 'ft_wyt' of http://www.caoxiaozhu.com:13001/YG-Soft/YG_FT into ft_wyt
|
2026-08-03 17:34:23 +08:00 |
|
wuyongtao
|
4e5c43fad5
|
feat: 评测任务元数据增强与前端展示优化
后端:
- 新增评测指标标签生成(_build_eval_metric_label/_basic_metric_labels)
- eval 任务 payload 富化(_enrich_eval_payload): 解析模型名/数据集名/维度配置, 生成 metric_label
- 任务创建时解析 trained_models/模型名, metric 回退为 metric_label
- 运行时状态刷新增加 2s 节流, 避免频繁触发
前端:
- EvalTask 类型增加 dataset_id/metric_label
- 评测列表与详情展示 metric_label 指标标签, 模型名/指标超长 tooltip 省略
- 创建页改用 getComputeGpus 过滤空闲 GPU, 移除 getSystemInfo 依赖
|
2026-08-03 17:34:21 +08:00 |
|
wangjiming
|
62a1d03eac
|
更新前端看板1
|
2026-08-03 17:24:45 +08:00 |
|
wangjiming
|
94230cad16
|
更新前端看板
|
2026-08-03 16:33:08 +08:00 |
|
wangjiming
|
0c601934a0
|
更新前端看板
|
2026-08-03 16:20:21 +08:00 |
|
wuyongtao
|
5cc306eb0a
|
fix: 推理/评测结果同步、数据集统计与算力节点管理增强
后端:
- 抽取 fetch_eval_result_content 复用函数,model_eval_detail 直接应用评测任务结果
- health 接口移除数据库依赖,返回静态指标
- 数据集: count_dataset_records JSON 感知计数; 文件统计改为从 dataset_files 聚合重算; 在线编辑记录 size/record_count/version_no; 上传同步批处理
- 算力节点: 调度支持 requested GPU 子集校验与容量计算; 新增 delete_compute_node(含活动任务保护)及 DELETE 接口; 连接池 connect_timeout
- 评测任务落库 basic_metrics/score/completed_time, failed/stopped 记录 error
评测引擎:
- _load_dataset 支持 JSON/JSONL 文件
- 新增 exact match 与文本相似度指标, 余弦相似度去掉 2 样本限制
前端:
- 算力节点列表「维护」改为「删除」(带确认弹窗), compute.ts 新增 deleteComputeNode
- 数据集上传超时调整为 120s; FineTuneTask 增加 compute_node_id; GpuInfo 状态增加 reserved
|
2026-08-03 15:49:21 +08:00 |
|
wuyongtao
|
cc08b164d0
|
fix: 前端表格行类型断言修复并补充 psycopg-pool 依赖
- 审批/项目/租户/用户设置等视图新增 asXxx 类型断言辅助函数
- search-fields 由字符串改为数组传参
- backend 依赖新增 psycopg-pool,Dockerfile 依赖校验同步更新
|
2026-08-03 11:02:41 +08:00 |
|
wuyongtao
|
24c77a990a
|
Merge branch 'ft_wyt' of http://www.caoxiaozhu.com:13001/YG-Soft/YG_FT into ft_wyt
# Conflicts:
# backend/app/api/v1/endpoints/platform.py
# compute/requirements.txt
|
2026-08-03 09:42:49 +08:00 |
|
wangjiming
|
15c4223f2c
|
update
|
2026-08-03 09:34:08 +08:00 |
|
caoxiaozhu
|
b975de02da
|
fix: 完善数据预处理与 JSON 上传链路
|
2026-07-30 16:54:00 +08:00 |
|
wuyongtao
|
46d343fb63
|
chore: compute requirements.txt 新增评测依赖 sacrebleu / rouge-score / scikit-learn
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-07-29 14:27:48 +08:00 |
|
wuyongtao
|
0c39f2f5b9
|
feat: 模型评测端到端闭环 — EvalRunner引擎 + 算力节点Job执行 + 结果回写
算力节点 (compute):
- 新建 eval_runner.py: 评测执行引擎,作为subprocess运行
- 加载模型 + JSONL数据集 + 逐样本推理
- BLEU/ROUGE/Cosine基础指标计算
- LLM Judge评分(OpenAI兼容API调用)
- 结果写入eval_results.json
- adapter.py: build_command新增engine=eval分支
- main.py: 新增/json模块导入,新增/compute/files/read端点,eval job校验
后端:
- platform.py: 重写startEval提交eval job到算力节点
- 支持models表和trained_models表查找
- 已合并模型不传adapter路径
- platform_store.py: 新增update_eval_task/running_eval_tasks/apply_eval_job_result
- sync.py: poller新增eval job同步,异步读取eval_results.json回写结果
前端:
- EvalCreateView/DimensionCreateView: eval模型过滤扩展(API类型+api_url)
- EvalCreateView: GPU过滤在线节点空闲GPU
- EvalTaskSetupStep: GPU value从数组index改为gpu.id
- BasicMetricSetupStep: ROUGE方法名修正(rouge_1→rouge1)
- EvalView: 新增5秒轮询刷新
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-07-28 19:34:41 +08:00 |
|
wuyongtao
|
c7c9ed925b
|
feat: 模型推理端到端闭环 — 真实流式推理 + 释放/删除 + GPU 状态同步
后端 (platform.py + platform_store.py):
- 新增 _build_messages_payload() 转换前端格式为 OpenAI messages
- 新增 _stream_chat_proxy() SSE 流式代理到算力节点
- 新增 _unload_from_compute_node() 真正释放算力节点 GPU 显存
- 重写 model_compare_load: 从假 PID/端口改为真正调用算力节点加载模型
- 修复 model_compare_unload: 调用 _unload_from_compute_node 释放 GPU
- 修复 model_compare_delete: 先释放 GPU 再删除记录
- 修复 model_compare_stream_chat: 从 mock 改为 StreamingResponse 代理
- 修复 model_chat_local/stream: 消息格式转换 + 路径修正
- PlatformStore 新增 _inference_nodes 追踪,gpus() 同步推理占用状态
- preload/unload 端点标记/清除推理节点占用
算力节点 (compute):
- inference.py: 适配新版 LLaMA-Factory API (get_infer_args 4 返回值、ChatModel args dict、stream_chat 新签名)
- inference.py: unload() 增加 gc.collect + torch.cuda.empty_cache + synchronize 彻底释放显存
- main.py: inference/load 移除 HTTPException(500),错误以 200 正常返回
前端:
- InferenceChatView: 真实模式下走 SSE 流式推理,mock 模式保留兼容
- InferenceCreateView: 调用 preloadLocalModel + createCompare 真实创建推理任务,失败回退 mock
- InferenceListView: 「停止」改为「释放」,删除前先释放算力节点,改进错误提示
- compare.ts: 新增 streamChatReal() fetch SSE,preload 超时提升至 5 分钟
- useStreamChat.ts: send() 支持 useMock 参数,真实模式调用 streamChatReal
- GPU 选择过滤: 仅显示在线算力节点上的空闲 GPU
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-07-28 17:29:16 +08:00 |
|
wuyongtao
|
f917a025e1
|
feat: 基于 LLaMA-Factory 实现模型推理引擎
利用容器内已有的 LLaMA-Factory ChatModel (huggingface 后端) 实现真实
模型推理,无需额外安装 vLLM。
Compute 端新增:
- compute/engines/llama_factory/inference.py
InferenceSession: 模型加载/卸载/对话/流式输出
支持 base model 和 LoRA adapter,线程安全
- compute/api/main.py 新增 5 个推理端点:
POST /inference/load - 加载模型
POST /inference/unload - 卸载释放 GPU 显存
GET /inference/status - 查询会话状态
POST /inference/chat - 非流式对话
POST /inference/chat/stream - SSE 流式对话
后端新增:
- platform.py 推理代理端点(local/chat, local/chat/stream,
local/preload, local/unload, local/status, trained/preload)
- ComputeNodeClient._request 通用请求方法
- _select_first_online_node 自动选择在线节点
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-07-28 13:49:10 +08:00 |
|
wuyongtao
|
a9ab130d43
|
feat: P0 训练闭环核心功能实现
P0-1 模型路径治理:
- 新增 003_model_path_governance.sql 迁移,models 表增加 can_train 字段
- create_model/update_model 自动计算 can_train(非API+有路径=可训练)
- _compute_job_payload_from_task_node 拒绝 API 模型和无可训练路径模型
- 平台诊断规则增加 API 模型/路径缺失检测
P0-2 数据集格式校验:
- 新增 dataset_format.py,支持 Alpaca/ShareGPT/DPO/CPT 格式校验
- 训练预检时自动根据 train_type 匹配格式并校验内容字段
- llama_dataset_info 增加 DPO/CPT 格式列映射
P0-3 训练完成产物入库:
- _ensure_trained_model 使用 compute 节点返回的真实 artifacts
- 注册 per-file artifact 记录(含 size_bytes/checksum_sha256)
- trained_models 表增加 artifact_dir 字段
P0-4 失败日志拉取:
- poll_compute_jobs_once 检测到 failed/stopped 时强制拉取最后 200 行日志
- apply_compute_job 持久化失败日志片段到任务 payload
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-07-28 13:10:53 +08:00 |
|
wuyongtao
|
525fc55cef
|
fix: 修复 GPU 选择索引错误及 CUDA 不可用问题,优化 GPU 硬件单选
- 修复 FineTuneCreateView GPU 选择使用 v-for idx 替代真实 gpu.id 导致
多节点环境下 GPU 索引错误(如 gpu-node-02 仅 GPU 0 但请求 GPU 1)
- GPU 选择改为单选模式,已离线节点自动过滤不展示
- GPU 卡片增加节点编号展示
- 修复 CUDA_VISIBLE_DEVICES=all 无效值导致 torch.cuda.is_available() False
改为 CUDA_VISIBLE_DEVICES=0
- .gitignore 新增 .claude/ CLAUDE.md 排除规则
- GpuInfo 类型增加 node_id/node_code/node_name 字段
Co-Authored-By: Claude <noreply@anthropic.com>
|
2026-07-28 12:43:20 +08:00 |
|