费米集群 · Fermion Cluster
自主可控的
GPU 调度集群。
整合计算、存储与网络资源,统一调度与运维管理。支持国产 CPU/GPU/NPU 与麒麟、欧拉等操作系统,为大模型研发、具身智能与智算云提供底层基座。
上海高新成果转化认定 · 组件自主可控 · 数据留在自有环境
除了租用云服务和自行集成,智算团队还有第三种选择。
租用云服务,需要适应供应商的限制;自行集成工具,则要长期承担维护成本。费米集群提供统一的 GPU 调度与运维管理能力,部署在您自己的基础设施上,兼顾国产异构算力与自主可控。
租用云服务
- 提示词、模型权重和数据存放在供应商的基础设施上,难以完全自主掌控
- token 单价由供应商制定,费用受其价格调整影响
- 功能更新、接口停用和可用区域都受供应商安排限制
- 合规要求需要与供应商逐项协商落实
自行集成多个开源工具
- JupyterHub + 训练工具 + 模型仓库 + 网关 + 仪表盘……
- 身份认证、配额管理和审计需要团队自行集成并长期维护
- 升级时需要重新验证集成,功能缺口和故障由团队自行处理
- 平台团队还需承担产品开发工作,增加人员和预算压力
费米集群 — 统一调度,自主可控
- 整合计算、存储、网络资源,实现算力统一调度与运维管理
- 支持国产 CPU(X86 / C86 / ARM)与昇腾、寒武纪、海光、燧原、沐曦、登临等加速卡
- 适配 Ubuntu、CentOS 及银河麒麟、欧拉等国产操作系统,组件达到自主可控要求
- 可作为大模型、具身智能与智算云的底层基座,支持跨域异构协同调度
登录控制台,就能用上算力。
日常路径在浏览器里完成:选资源池、开开发环境或提交作业,再到费用中心核对算力点。已有 Slurm 脚本可继续用 sbatch。
选池开机,浏览器进入终端
# 在费米集群控制台 1. 打开「开发环境」→ 新建 2. 选择资源池、镜像与 GPU 规格 3. 开机(资源不足时可排队) 4. 打开 Web 终端进入容器 Shell $ nvidia-smi GPU 0: ... # 用完关机,卡回到资源池;需要固化时保存镜像
平台管算力生命周期与 Web 终端;IDE 与框架由所选镜像提供。批处理训练请走作业通道。
容器走 Volcano,脚本走 Slurm
# 容器作业 1. 控制台 → 作业 / 队列 2. 选资源池、镜像、规格并提交 3. 排队不计费;分配后查看日志 # 已有 HPC 脚本 $ sbatch train.slurm # 与容器作业分池,同一套账号与出账
调试用开发环境,批处理用作业。Volcano 与 Slurm 物理分池,费用中心统一看消耗。
排队不计费,分配后出账
# 计费边界 开发环境:关机不计 GPU 时长;开机占用按量小时 作业:排队不计费;分配到卡后按分配时段计量 Slurm:依据分配事实计入 存储:按卷容量(GiB)计量 → 费用中心查看算力点、订单与明细
私有化可按内部核算运行。登录称「账号」,计费称「账户」,对外统一「算力点」。
数据进卷,环境进镜像
# 存储 1. 创建存储卷并挂到开发环境 2. 关机后卷上数据仍保留 # 镜像 3. 选用模板镜像,或从镜像源导入 4. 环境稳定后保存镜像,下次作业直接选用 # 模型权重与数据集在「模型服务」登记
卷放数据,镜像放运行时。开环境或提交作业时直接选用,不必另接外部协议客户端。
一个产品:费米集群。六项能力。
费米集群提供统一控制台,覆盖开发、作业、模型、存储镜像与计费,共用账号、资源池与出账口径。
从登录、开通算力到提交作业与查看费用,日常路径都在同一套界面里完成。
统一调度,国产异构可落地。
费米集群面向智算中心、科研机构与行业客户,在资源调度、权限鉴权与容灾备份等方面形成完整闭环,支撑敏感数据留在自有环境。
计算 · 存储 · 网络一体调度
计算模块精细调度资源池,存储模块保障数据安全,网络模块搭建高速通道,实现算力及相关资源的统一调度与运维管理。
用户管理与服务鉴权
完善的权限与服务鉴权提供个性化服务,确保数据与操作安全;并配套数据标注、容灾备份等能力,全方位守护用户资产。
国产异构与自主可控
支持跨域异构算力协同调度与混合训练全流程适配;组件达到自主可控要求,可部署于自有数据中心、VPC 或物理隔离环境。
面向智算研发与平台运维团队。
费米集群适用于互联网、金融、医疗、教育、科研等行业,以及需要国产异构算力与数据自主可控的机构,为大模型研发与行业智能化提供支撑。