fix: 算力节点任务/GPU 统计纳入评测与推理占用,补充测试依赖
- compute_nodes() 的 current_running_jobs 纳入运行中的评测任务(eval_tasks) 与已加载的推理模型(compare_tasks 持久化状态 + 内存标记兜底), 多节点时 GPU 被评测/推理占用不再显示 0/1 - gpus() 直接按 eval_tasks / compare_tasks 派生 GPU busy/reserved 状态, 修复 gpu_id=0 时 or -1 导致匹配失败;删除评测后 GPU 不再残留 busy - 评测不再复用 mark_inference_loaded 内存标记,GPU 占用由任务数据驱动 - requirements.txt 补充 pytest / ruff(此前仅声明在 pyproject dev 可选依赖) Co-Authored-By: Claude <noreply@anthropic.com>
This commit is contained in:
@@ -174,9 +174,7 @@ async def poll_compute_jobs_once() -> dict[str, Any]:
|
||||
except Exception:
|
||||
pass
|
||||
store.apply_eval_job_result(eval_task["id"], job, result_content)
|
||||
# If job completed, un-mark inference loaded
|
||||
if job.get("status") in {"completed", "failed", "stopped"}:
|
||||
store.mark_inference_unloaded(node["id"])
|
||||
# 评测 GPU 占用由 eval_tasks 状态派生,无需维护推理内存标记
|
||||
eval_synced += 1
|
||||
except Exception as exc: # noqa: BLE001
|
||||
failed.append({"eval_task_id": eval_task["id"], "error": str(exc)})
|
||||
|
||||
Reference in New Issue
Block a user