feat: 评测创建支持基础指标配置与启动参数类型化

新增 StartEvalPayload 与 BasicEvalMetricsConfig 类型约束启动评测接口,创建向导补充 BLEU、ROUGE、余弦相似度等基础指标配置,维度表单与规则步骤同步调整,回归脚本扩充断言。
This commit is contained in:
caoxiaozhu
2026-07-14 09:40:17 +08:00
parent 762d48d090
commit acbd6d91b3
6 changed files with 278 additions and 146 deletions

View File

@@ -5,7 +5,9 @@ import { ElMessage } from 'element-plus'
import PageCard from '@/components/PageCard.vue'
import EvalTaskSetupStep, { type EvalTaskSetupDraft } from './create/EvalTaskSetupStep.vue'
import EvalRuleSetupStep, { type EvalRuleSetupDraft } from './create/EvalRuleSetupStep.vue'
import { createDimension, getDimensionList, startEval } from '@/api/modules/eval'
import BasicMetricSetupStep, { type BasicMetricSetupDraft } from './create/BasicMetricSetupStep.vue'
import StartEvalStep from './create/StartEvalStep.vue'
import { createDimension, startEval } from '@/api/modules/eval'
import { getTrainedModels, getModelList } from '@/api/modules/model'
import { getDatasetList } from '@/api/modules/dataset'
import { getSystemInfo } from '@/api/modules/system'
@@ -19,15 +21,17 @@ const submitting = ref(false)
const currentStep = ref(0)
const taskStepRef = ref<StepExposed>()
const ruleStepRef = ref<StepExposed>()
const basicMetricStepRef = ref<StepExposed>()
const WIZARD_STEPS = [
{ title: '任务配置', description: '选择模型、算力与评测数据' },
{ title: '评测规则', description: '选择或创建评测维度' },
{ title: '大模型评测指标', description: '配置评测模型、方式与标准' },
{ title: '基础评测指标', description: '选择 BLEU、ROUGE 等参考指标' },
{ title: '开始评测', description: '确认配置并启动评测任务' },
] as const
const trainedModels = ref<TrainedModel[]>([])
const evalDatasets = ref<DatasetItem[]>([])
const dimensions = ref<Dimension[]>([])
const evalModels = ref<ModelItem[]>([])
const gpus = ref<GpuInfo[]>([])
const createdDimensionId = ref<string | number>('')
@@ -42,26 +46,31 @@ const taskForm = ref<EvalTaskSetupDraft>({
})
const ruleForm = ref<EvalRuleSetupDraft>({
ruleMode: 'new',
dimension_id: '',
newDimension: {
type: '',
description: '',
eval_model: '',
eval_method: '',
eval_prompt: '',
is_active: true,
is_default: false,
bleu_n: 1,
output_precision: 3,
score_min: 0,
score_max: 5,
pass_threshold: 3,
},
type: '',
description: '',
eval_model: '',
eval_method: '',
eval_prompt: '',
is_active: true,
is_default: false,
bleu_n: 1,
output_precision: 3,
score_min: 0,
score_max: 5,
pass_threshold: 3,
})
const basicMetricForm = ref<BasicMetricSetupDraft>({
bleu_enabled: false,
bleu_n: 4,
rouge_enabled: false,
rouge_methods: ['rouge_1', 'rouge_2'],
cosine_enabled: false,
output_precision: 3,
})
watch(
() => ruleForm.value.newDimension,
ruleForm,
() => {
createdDimensionId.value = ''
},
@@ -72,20 +81,18 @@ async function loadData() {
loading.value = true
const results = await Promise.allSettled([
getTrainedModels(),
getDimensionList(),
getDatasetList(),
getSystemInfo(),
getModelList(),
])
if (results[0].status === 'fulfilled') trainedModels.value = results[0].value?.models || []
if (results[1].status === 'fulfilled') dimensions.value = results[1].value || []
if (results[2].status === 'fulfilled') {
evalDatasets.value = (results[2].value || []).filter((dataset) => dataset.type === 'eval')
if (results[1].status === 'fulfilled') {
evalDatasets.value = (results[1].value || []).filter((dataset) => dataset.type === 'eval')
}
if (results[3].status === 'fulfilled') gpus.value = results[3].value?.gpu || []
if (results[4].status === 'fulfilled') {
evalModels.value = (results[4].value || []).filter((model) => model.purpose === 'evaluation')
if (results[2].status === 'fulfilled') gpus.value = results[2].value?.gpu || []
if (results[3].status === 'fulfilled') {
evalModels.value = (results[3].value || []).filter((model) => model.purpose === 'evaluation')
}
const failedCount = results.filter((result) => result.status === 'rejected').length
@@ -95,25 +102,19 @@ async function loadData() {
loading.value = false
}
function buildDimensionPayload() {
const draft = ruleForm.value.newDimension
const draft = ruleForm.value
const payload: Partial<Dimension> = {
name: `Custom_Dim_${Date.now()}`,
type: draft.type,
description: draft.description,
eval_model: draft.type === 'text_similarity' ? undefined : draft.eval_model,
eval_model: draft.eval_model,
eval_method: draft.eval_method,
eval_prompt: draft.type === 'text_similarity' ? undefined : draft.eval_prompt,
eval_prompt: draft.eval_prompt,
is_active: draft.is_active,
is_default: draft.is_default,
create_time: new Date().toISOString(),
}
if (draft.type === 'text_similarity') {
payload.bleu_n = draft.bleu_n
payload.output_precision = draft.output_precision
}
if (draft.type === 'metric') {
payload.score_min = draft.score_min
payload.score_max = draft.score_max
@@ -123,8 +124,6 @@ function buildDimensionPayload() {
}
async function resolveDimensionId() {
if (ruleForm.value.ruleMode === 'baseline') return ''
if (ruleForm.value.ruleMode === 'existing') return ruleForm.value.dimension_id
if (createdDimensionId.value !== '') return createdDimensionId.value
const created = await createDimension(buildDimensionPayload())
@@ -137,24 +136,32 @@ async function resolveDimensionId() {
async function handleSubmit() {
if (loading.value || submitting.value) return
const ruleValid = await ruleStepRef.value?.validate()
if (!ruleValid) {
ElMessage.warning('请检查并完善评测规则')
return
}
submitting.value = true
try {
const dimensionId = await resolveDimensionId()
await startEval({
eval_task_name: taskForm.value.eval_task_name,
eval_type: ruleForm.value.ruleMode === 'baseline' ? 'baseline' : 'custom',
eval_type: 'custom',
model_id: taskForm.value.model_id,
gpu_id: taskForm.value.gpu_id,
dataset_id: taskForm.value.data_source === 'dataset' ? taskForm.value.dataset_id : '',
dimension_id: dimensionId,
data_source: taskForm.value.data_source,
leaderboard: taskForm.value.leaderboard,
basic_metrics: {
bleu: {
enabled: basicMetricForm.value.bleu_enabled,
ngram: basicMetricForm.value.bleu_n,
},
rouge: {
enabled: basicMetricForm.value.rouge_enabled,
methods: basicMetricForm.value.rouge_methods,
},
cosine: {
enabled: basicMetricForm.value.cosine_enabled,
},
output_precision: basicMetricForm.value.output_precision,
},
})
ElMessage.success('评测任务已创建并启动')
router.push('/model-eval')
@@ -168,17 +175,33 @@ async function handleSubmit() {
async function handleNext() {
if (loading.value || submitting.value) return
const taskValid = await taskStepRef.value?.validate()
if (!taskValid) {
ElMessage.warning('请检查并完善任务配置')
return
if (currentStep.value === 0) {
const taskValid = await taskStepRef.value?.validate()
if (!taskValid) {
ElMessage.warning('请检查并完善任务配置')
return
}
}
currentStep.value = 1
if (currentStep.value === 1) {
const ruleValid = await ruleStepRef.value?.validate()
if (!ruleValid) {
ElMessage.warning('请检查并完善大模型评测指标')
return
}
}
if (currentStep.value === 2) {
const basicMetricValid = await basicMetricStepRef.value?.validate()
if (!basicMetricValid) {
ElMessage.warning('请检查并完善基础评测指标')
return
}
}
currentStep.value = Math.min(currentStep.value + 1, WIZARD_STEPS.length - 1)
}
function handleBack() {
if (submitting.value) return
currentStep.value = 0
currentStep.value = Math.max(currentStep.value - 1, 0)
}
function handleCancel() {
@@ -189,7 +212,10 @@ onMounted(loadData)
</script>
<template>
<PageCard title="新建评测任务" subtitle="完成任务配置与评测规则设置后启动评测">
<PageCard
title="新建评测任务"
subtitle="依次配置任务、大模型评测指标与基础评测指标,确认后开始评测"
>
<div class="create-wizard-layout">
<main v-loading="loading" class="wizard-main">
<div class="wizard-steps-container" aria-label="评测任务创建步骤">
@@ -207,6 +233,7 @@ onMounted(loadData)
'is-completed': currentStep > index,
}"
:aria-current="currentStep === index ? 'step' : undefined"
:aria-label="`${index + 1}. ${step.title}${step.description}`"
>
<div class="step-node">
<div class="step-icon" aria-hidden="true">
@@ -224,48 +251,64 @@ onMounted(loadData)
</div>
<div class="wizard-content">
<EvalTaskSetupStep
v-if="currentStep === 0"
ref="taskStepRef"
v-model="taskForm"
:trained-models="trainedModels"
:eval-datasets="evalDatasets"
:gpus="gpus"
:loading="loading"
:disabled="submitting"
/>
<EvalRuleSetupStep
v-else
ref="ruleStepRef"
v-model="ruleForm"
:dimensions="dimensions"
:eval-models="evalModels"
:loading="loading"
:disabled="submitting"
/>
<EvalTaskSetupStep
v-if="currentStep === 0"
ref="taskStepRef"
v-model="taskForm"
:trained-models="trainedModels"
:eval-datasets="evalDatasets"
:gpus="gpus"
:loading="loading"
:disabled="submitting"
/>
<EvalRuleSetupStep
v-else-if="currentStep === 1"
ref="ruleStepRef"
v-model="ruleForm"
:eval-models="evalModels"
:disabled="submitting"
/>
<BasicMetricSetupStep
v-else-if="currentStep === 2"
ref="basicMetricStepRef"
v-model="basicMetricForm"
:disabled="submitting"
/>
<StartEvalStep
v-else
:task="taskForm"
:llm-metric="ruleForm"
:basic-metrics="basicMetricForm"
:trained-models="trainedModels"
:eval-datasets="evalDatasets"
:eval-models="evalModels"
:gpus="gpus"
/>
</div>
</main>
<footer class="wizard-footer">
<el-button
v-if="currentStep === 1"
v-if="currentStep > 0"
class="footer-back"
:disabled="submitting"
@click="handleBack"
>
<i class="fa fa-arrow-left footer-button-icon" />返回任务配置
<i class="fa fa-arrow-left footer-button-icon" />返回{{ WIZARD_STEPS[currentStep - 1].title }}
</el-button>
<el-button v-else class="footer-back" :disabled="submitting" @click="handleCancel">
取消
</el-button>
<el-button
v-if="currentStep === 0"
v-if="currentStep < WIZARD_STEPS.length - 1"
type="primary"
:disabled="loading || submitting"
@click="handleNext"
>
下一步评测规则<i class="fa fa-arrow-right footer-button-icon is-right" />
下一步{{ WIZARD_STEPS[currentStep + 1].title }}<i
class="fa fa-arrow-right footer-button-icon is-right"
/>
</el-button>
<el-button
v-else
@@ -274,10 +317,10 @@ onMounted(loadData)
:disabled="loading || submitting"
@click="handleSubmit"
>
创建并启动评测
开始评测
</el-button>
</footer>
</div>
</div>
</PageCard>
</template>
@@ -305,7 +348,7 @@ onMounted(loadData)
display: flex;
align-items: center;
justify-content: space-between;
max-width: 760px;
max-width: 1120px;
margin: 0 auto;
padding: 0 20px;
}
@@ -319,7 +362,7 @@ onMounted(loadData)
.step-connector {
flex: 1;
height: 2px;
margin: 0 20px;
margin: 0 12px;
background: #e2e8f0;
transition: background-color 0.2s ease;
}
@@ -414,6 +457,12 @@ onMounted(loadData)
margin-left: 6px;
}
@media (max-width: 1100px) {
.step-description {
display: none;
}
}
@media (max-width: 760px) {
.wizard-main {
padding: 24px 20px;
@@ -424,10 +473,10 @@ onMounted(loadData)
}
.step-connector {
margin: 0 10px;
margin: 0 8px;
}
.step-description {
.step-text {
display: none;
}