算力调度平台

EgoLoong 算力调度平台

统一查看、申请和释放服务机 CPU、内存、GPU 与显存 · 当前用户:

服务机实时监控

自动刷新:每 5 秒 · 最近刷新:--。实时使用量来自节点 Metrics 和 NVIDIA 驱动;“已分配”是调度系统为任务保留的资源。

节点监控状态CPU 实时 / 已分配内存实时 / 已分配GPU 实时 / 已分配显存实时

GPU 实时详情

节点 / GPU型号核心利用率显存利用率温度功耗

共享存储监控

存储盘类型状态已用 / 总容量可用容量任务内路径

申请算力并提交任务

任务会自动挂载共享存储:机械盘 /shared/hdd,固态盘 /shared/ssd

计算任务

任务类型 / 申请人状态节点创建时间操作

算力平台使用说明

1. 这个平台负责什么

算力平台位于第一层,统一管理服务机的 CPU、内存、GPU 和显存。用户在这里申请资源并提交任务;数据平台、模型训练和模型推理都只是任务类型,不拥有独立的机器。任务结束或被删除后,资源自动释放。

2. 登录与密码

使用管理员分配的个人用户名和密码登录。初始密码需要自行妥善保存;可在页面底部修改自己的密码。密码只以加盐哈希形式保存在控制机本地。

3. 先查看实时状态和可分配资源

顶部卡片显示整个资源池的实时 CPU、内存、GPU 和显存利用率。服务机表每 5 秒刷新,实时值来自 Metrics API 与 NVIDIA 驱动;GPU 详情还显示每张卡的温度和功耗。“已分配”表示调度系统已为 Pending 或 Running 任务保留的资源,是平台判断还能否接收任务的依据。瞬时利用率较低不代表已经分配给任务的资源可以被其他任务占用。

4. 如何申请并提交任务

  1. 选择任务类型:通用容器、数据平台管线、模型训练或模型推理。
  2. 填写唯一任务名,只使用小写字母、数字和短横线。
  3. 填写容器镜像。镜像需要已经导入服务机,或服务机可以从镜像仓库拉取。
  4. 填写单个任务实例需要的 CPU 核数、内存、GPU 数量和总显存预算。
  5. 通常让平台自动选择节点;只有调试或数据固定在某台机器时才指定节点。
  6. 填写容器启动命令并提交。平台检查实时空闲量,选择能同时满足全部条件的节点,然后创建任务。

所有任务都会自动挂载共享存储:机械盘位于 /shared/hdd/disk1/shared/hdd/disk9,固态盘位于 /shared/ssd/ssd1/shared/ssd/ssd2。多个节点可以读写同一文件;高频临时数据优先放固态盘,大型数据集和归档放机械盘。

5. 资源如何占用和释放

CPU、内存和 GPU 的 requests 与 limits 相同,任务不能临时突破申请量。任务处于 Pending 或 Running 时计入已分配量;成功、失败或手动删除后释放调度资源。显存预算用于选机,页面同时展示 NVIDIA 驱动报告的实际显存使用量。

6. 常用示例

用途建议填写命令示例
CPU 数据处理通用容器;4 CPU;8GiB 内存;0 GPUpython /workspace/process.py
单卡 GPU 验证模型推理;2 CPU;8GiB 内存;1 GPU;20GiB 显存nvidia-smi && python /workspace/infer.py
数据管线阶段数据平台管线;按该阶段实际需求申请python /pipeline/run_stage.py

7. 多机大任务

当前表单提交的是单节点容器任务,因此单次填写不能超过一台机器的物理容量。比如“150GiB 显存和 100 个 CPU 核”不能放进当前任一单节点,应拆成多个可并行分片,例如两个任务各申请 50 CPU、1 张 SuperGPU 和 75GiB 显存。数据管线应按样本或阶段生成这些子任务,并由同一个业务运行编号汇总。后续的分布式任务模板会把这一步自动化。

8. 查看结果与排错

任务表显示状态和实际节点。“日志”查看容器最后 500 行输出;“删除”会停止任务并释放资源。任务长期 Pending 时,先检查是否仍有足够的 CPU、内存、GPU 和显存,再检查镜像是否存在。镜像拉取失败和程序退出会保留在任务状态与日志中。

9. 共享存储

共享存储服务器是 192.168.1.100,使用 SMB 3.1.1。平台监控 9 块机械盘和 2 块固态盘的在线状态、已用量和剩余容量。任务不需要填写存储密码,平台会自动挂载;请避免多个任务同时覆盖同一个输出文件,建议按用户名和任务名建立目录。

修改我的密码