异构算力调度平台
DIGIT 算力调度平台
数工科技自研的平台层软件,统一编排、监控与运维。随 AI 算力中心项目交付,也可单独采购、私有化部署。
已适配 GPU
6 家厂商,接入层均为数工科技自研
天数智芯 GPU
自研接入层与设备插件,整卡与切分两种模式
已适配昇腾 GPU
自研接入层,资源名随卡型映射
已适配寒武纪 GPU
自研接入层,两套资源名统一纳管
已适配海光 DCU
自研接入层,显存与算力配额兜底
已适配沐曦 GPU
自研接入层,显存单位换算归一
已适配NVIDIA GPU
自研接入层,指标与告警接入监控
已适配上述商标归各自权利人所有,列出仅表示兼容性,不代表合作或背书。
平台能力
资源池化
跨厂商 GPU 分组为可分配算力池
- 整卡分配与 vGPU 显存、算力切分
- 资源池按节点标签分组,可跨厂商
多租户配额
租户隔离,配额双层兜底
- 卡数、显存、算力三维配额
- 超额申请直接拒绝,不建任何资源
权限与审计
平台级 + 租户级双层角色
- 平台级与租户级共 6 个角色
- 写操作全量记录:人、动作、对象、结果
自助算力
租户自助提交负载
- 算力工作负载按卡数与显存申请
- Jupyter Notebook 一键启动
监控告警
从集群到单卡的实时视图
- 利用率、温度、功耗与 ECC 错误计数
- 内置 27 条告警,对接现有 Alertmanager
交付与接入
离线内网可交付
- 离线交付包,容器镜像带签名
- 节点接入 CLI,先预检再执行
平台架构
控制面与节点侧组件
- 01
控制面:API、控制器与控制台,部署在客户集群内
- 02
节点侧:设备插件与指标采集,随节点部署包安装
- 03
调度:Kubernetes 原生调度;切分模式加装扩展调度
部署前提
客户集群需具备的底座
- Kubernetes 1.28 及以上
- PostgreSQL 16 及以上,连接强制 TLS
- Prometheus 承接指标采集与告警
- 接入模式二选一:整卡分配或显存切分

