跳转到主内容
数工科技DIGIT·CN

异构算力调度平台

DIGIT 算力调度平台

数工科技自研的平台层软件,统一编排、监控与运维。随 AI 算力中心项目交付,也可单独采购、私有化部署。

已适配 GPU

6 家厂商,接入层均为数工科技自研

天数智芯 GPU

自研接入层与设备插件,整卡与切分两种模式

已适配

昇腾 GPU

自研接入层,资源名随卡型映射

已适配

寒武纪 GPU

自研接入层,两套资源名统一纳管

已适配

海光 DCU

自研接入层,显存与算力配额兜底

已适配

沐曦 GPU

自研接入层,显存单位换算归一

已适配

NVIDIA GPU

自研接入层,指标与告警接入监控

已适配

上述商标归各自权利人所有,列出仅表示兼容性,不代表合作或背书。

平台能力

资源池化

跨厂商 GPU 分组为可分配算力池

  • 整卡分配与 vGPU 显存、算力切分
  • 资源池按节点标签分组,可跨厂商

多租户配额

租户隔离,配额双层兜底

  • 卡数、显存、算力三维配额
  • 超额申请直接拒绝,不建任何资源

权限与审计

平台级 + 租户级双层角色

  • 平台级与租户级共 6 个角色
  • 写操作全量记录:人、动作、对象、结果

自助算力

租户自助提交负载

  • 算力工作负载按卡数与显存申请
  • Jupyter Notebook 一键启动

监控告警

从集群到单卡的实时视图

  • 利用率、温度、功耗与 ECC 错误计数
  • 内置 27 条告警,对接现有 Alertmanager

交付与接入

离线内网可交付

  • 离线交付包,容器镜像带签名
  • 节点接入 CLI,先预检再执行

平台架构

控制面与节点侧组件

  1. 01

    控制面:API、控制器与控制台,部署在客户集群内

  2. 02

    节点侧:设备插件与指标采集,随节点部署包安装

  3. 03

    调度:Kubernetes 原生调度;切分模式加装扩展调度

部署前提

客户集群需具备的底座

  • Kubernetes 1.28 及以上
  • PostgreSQL 16 及以上,连接强制 TLS
  • Prometheus 承接指标采集与告警
  • 接入模式二选一:整卡分配或显存切分

配置与报价

提供 GPU 型号与节点数,数工科技给出接入方案。