模型开发(管理视角)
「模型开发(管理视角)」面向平台/租户管理员,用于跨工作空间、跨项目查看和管理训练任务、微调任务与评测任务。管理员可以代表某个项目创建任务,也可以对所有任务执行批量运维操作。
入口路径:左侧菜单 AI 智算管理 > 模型开发,页面路由
/admin/ai/model。

页面菜单
| 页面 | 路由 | 说明 |
|---|---|---|
| 训练任务 | /admin/ai/manage/training | 跨租户训练任务列表与管理 |
| 创建训练任务 | /admin/ai/manage/training/create | 代指定项目创建训练任务 |
| 训练任务详情 | /admin/ai/manage/training/detail/:uuid | 查看任务详情、日志、TensorBoard |
| 微调任务 | /admin/ai/manage/finetuning | 跨租户微调任务列表与管理 |
| 创建微调任务 | /admin/ai/manage/finetuning/create | 代指定项目创建微调任务 |
| 微调任务详情 | /admin/ai/manage/finetuning/detail/:uuid | 查看任务详情、loss 曲线、导出模型 |
| 评测任务 | /admin/ai/manage/evaluation | 跨租户评测任务列表与管理 |
| 创建评测任务 | /admin/ai/manage/evaluation/create | 代指定项目创建评测任务 |
| 评测任务详情 | /admin/ai/manage/evaluation/detail/:uuid | 查看评测报告与指标 |
训练任务
查看与筛选训练任务
- 进入 AI 智算管理 > 模型开发 > 训练任务。
- 在列表顶部筛选栏选择查询条件:
- 工作空间:选择目标租户,留空表示全部。
- 项目:选择工作空间后联动显示项目列表。
- 状态:按运行中、已完成、失败、Pending 等状态过滤。
- 队列:按 Volcano 训练队列过滤。
- 创建人/名称:支持关键词搜索。
- 列表默认展示:名称/ID、任务状态、实例数、CPU/内存、GPU(含物理算力规格)、节点/IP、队列、所属工作空间、所属项目、创建人、创建时间、运行时长。
- 点击右上角「监控视图」可切换为实时资源利用率视图,展示 CPU、内存、GPU、GPU 显存利用率。
- 点击任务名称进入详情页,查看「基本信息」「容器组」「运行日志」「事件」「训练进度」「TensorBoard」等页签。


代项目创建训练任务
- 在训练任务列表页点击「创建训练任务」。
- 基础信息
- 工作空间/项目:选择目标租户和项目。
- 任务名称:2-50 个字符。
- 训练框架:PyTorch / TensorFlow / MPI / DeepSpeed。
- 队列:选择 Volcano 训练队列。
- 优先级:高/中/低,影响调度顺序。
- TensorBoard:平台会自动为训练任务挂载 TensorBoard 日志存储。
- 任务规格
- 选择架构(x86 / ARM)与 GPU 类型(共享/独享/超分)。
- 在规格列表中选择 CPU、内存、GPU 卡数/算力/显存配置。
- 任务镜像
- 基础镜像:平台预置的训练镜像。
- 自定义镜像:租户保存的镜像。
- 外部镜像地址:填写完整镜像地址及仓库密码。
- 存储配置
- 挂载公共存储(如预训练模型仓库)。
- 挂载自定义存储(如代码、数据、输出目录)。
- 任务配置
- Master/Worker 副本数:按框架显示不同名称(如 PyTorch 为 master/worker)。
- 最小可用实例数:调度时至少满足的实例数,低于此值任务不会开始运行。
- 启动命令/启动参数:每行一条命令或一个参数。
- 注解、环境变量。
- 高级配置(选填)
- 超时时间:任务运行最大小时数。
- 自动重试:失败后的最大重试次数。
- workingDir、启动用户、共享内存。
- 点击「创建」,返回列表查看任务状态。

批量管理训练任务
- 在列表左侧勾选多个已停止的训练任务。
- 列表上方会出现批量操作条:
- 批量删除:删除选中的终态任务,释放 VcJob 资源;删除前需二次确认。
- 多选运行中任务后,点击「共享 TensorBoard」可一键启动共享 TensorBoard 实例,实现多任务训练指标横向对比。
微调任务
查看与筛选微调任务
- 进入 AI 智算管理 > 模型开发 > 微调任务。
- 使用顶部筛选栏按工作空间、项目、状态、框架、创建人、任务名称查询。
- 列表展示:名称/ID、状态、框架、微调方式(LoRA/QLoRA/Full)、基础模型、CPU/内存、GPU、所属工作空间、所属项目、创建人、运行时长。
- 点击任务名称进入详情页,查看训练 loss 曲线、指标变化、全量训练参数配置清单。


代项目创建微调任务
- 在微调任务列表页点击「创建微调任务」。
- 基础信息
- 工作空间/项目:选择目标租户和项目。
- 任务名称:2-50 个字符。
- 训练阶段:SFT / DPO / KTO / RM / PPO。
- 微调方法:LoRA / Full / QLoRA;PPO/RM 阶段仅支持 LoRA/QLoRA。
- 数据集
- 选择已创建的训练数据集和版本。
- 如开启自动评测,选择评测数据集。
- 模型
- 基础模型路径:填写模型在存储中的绝对路径(如
/models/qwen2-7b),或 HuggingFace/ModelScope 仓库 ID。 - 如果填写本地绝对路径,必须先在「存储配置」中挂载覆盖该路径的存储。
- 基础模型路径:填写模型在存储中的绝对路径(如
- 算力规格与镜像
- 选择 GPU 规格;平台会根据显卡厂商自动过滤可用镜像。
- 选择或填写微调镜像。
- 存储配置
- 挂载公共/自定义存储,覆盖模型路径、数据集路径和输出目录。
- 输出目录:必须在已挂载的可写自定义存储路径下,用于保存 LoRA 适配器或全量模型。
- 训练参数
- 选择预设模板(快速 / 标准 / 质量)或手动配置:
- epochs、learning rate、batch size、gradient accumulation steps
- cutoff len、val size、lora rank、lora alpha
- 高级用户可在
yamlOverride中覆盖任意 LLaMA-Factory 参数。
- 选择预设模板(快速 / 标准 / 质量)或手动配置:
- 点击「创建」,任务开始运行。

微调任务后续操作
- 导出模型:微调完成后,在详情页点击「导出模型」,将 LoRA 适配器与基础模型合并,导出为可部署的完整模型。
- 对比推理:导出后发起临时推理服务,对比微调前后效果。
- 自动评测:训练完成后自动触发评测任务,查看评测报告。
- 手动评测:在详情页通过更多操作菜单手动对已完成/已停止的微调任务触发评测。
评测任务
查看与筛选评测任务
- 进入 AI 智算管理 > 模型开发 > 评测任务。
- 使用顶部筛选栏按工作空间、项目、状态、任务名称查询;列表支持 SSE 实时推送刷新状态。
- 列表展示:名称/ID、状态、关联微调任务、评测模式、CPU/内存、GPU、所属工作空间、所属项目、创建人、运行时长。
- 点击任务名称进入详情页,查看评测结果表格(各维度指标评分、模型输出与参考输出对比)。


代项目创建评测任务
- 在评测任务列表页点击「创建评测任务」。
- 基础信息
- 工作空间/项目:选择目标租户和项目。
- 任务名称:2-50 个字符。
- 关联微调任务
- 选择一个已有的微调任务,系统会自动带入模型路径与数据集;也可独立创建。
- 目标类型:可选择「微调任务」或「在线服务」进行评测。
- 评测模式
- Auto-Eval:使用 LLaMA-Factory 内置指标(如 perplexity、bleu、rouge)。
- LLM-as-Judge:选择裁判模型和评分模板,对生成结果进行打分。
- 数据集与模型:选择评测数据集版本,确认模型路径。
- 算力规格:选择 GPU 规格;部分轻量评测可用 CPU。
- 点击「创建」,等待任务完成后查看评测报告。

常见问题
Q:训练任务状态 Pending 很久? A:查看详情页「事件」,常见原因是队列资源不足、镜像拉取慢、或最小可用实例数设置过高。
Q:微调任务提示「模型路径未挂载」? A:基础模型路径若是本地绝对路径,必须在「存储配置」中挂载包含该路径的存储;例如 /models/qwen2-7b 需要挂载 /models。
Q:评测任务失败但日志看不出原因? A:检查裁判模型是否可达、评测数据集格式是否符合要求(如 ShareGPT 格式),以及输出目录是否有写入权限。
Q:管理员能否为其他用户创建任务? A:可以。在创建表单中选择目标工作空间和项目后,任务会归属到该项目下;列表中创建人字段会显示当前管理员账号。