wuyongtao
0c39f2f5b9
feat: 模型评测端到端闭环 — EvalRunner引擎 + 算力节点Job执行 + 结果回写
算力节点 (compute):
- 新建 eval_runner.py: 评测执行引擎,作为subprocess运行
- 加载模型 + JSONL数据集 + 逐样本推理
- BLEU/ROUGE/Cosine基础指标计算
- LLM Judge评分(OpenAI兼容API调用)
- 结果写入eval_results.json
- adapter.py: build_command新增engine=eval分支
- main.py: 新增/json模块导入,新增/compute/files/read端点,eval job校验
后端:
- platform.py: 重写startEval提交eval job到算力节点
- 支持models表和trained_models表查找
- 已合并模型不传adapter路径
- platform_store.py: 新增update_eval_task/running_eval_tasks/apply_eval_job_result
- sync.py: poller新增eval job同步,异步读取eval_results.json回写结果
前端:
- EvalCreateView/DimensionCreateView: eval模型过滤扩展(API类型+api_url)
- EvalCreateView: GPU过滤在线节点空闲GPU
- EvalTaskSetupStep: GPU value从数组index改为gpu.id
- BasicMetricSetupStep: ROUGE方法名修正(rouge_1→rouge1)
- EvalView: 新增5秒轮询刷新
Co-Authored-By: Claude <noreply@anthropic.com>
2026-07-28 19:34:41 +08:00
..
2026-07-21 09:23:43 +08:00
2026-07-23 19:32:42 +08:00
2026-07-24 10:27:52 +08:00
2026-07-23 19:32:42 +08:00
2026-07-21 10:09:36 +08:00
2026-07-24 14:35:03 +08:00
2026-07-22 20:26:16 +08:00
2026-07-21 10:55:44 +08:00
2026-07-21 10:55:44 +08:00
2026-07-21 10:09:36 +08:00
2026-07-22 20:26:16 +08:00
2026-07-23 19:32:42 +08:00
2026-07-21 12:36:33 +08:00
2026-07-28 19:34:41 +08:00
2026-07-24 14:36:11 +08:00