费米集群 · Fermion Cluster

自主可控的
GPU 调度集群。

整合计算、存储与网络资源,统一调度与运维管理。支持国产 CPU/GPU/NPU 与麒麟、欧拉等操作系统,为大模型研发、具身智能与智算云提供底层基座。

上海高新成果转化认定 · 组件自主可控 · 数据留在自有环境

17
年 GPU 算力积淀
6+
国产 GPU/NPU 适配
3
类国产 CPU 架构
4+
主流/国产操作系统
100%
组件自主可控要求
1
上海高新成果转化认定
统一调度计算 · 存储 · 网络 · 跨域异构协同
§ 01 — 平台选择

除了租用云服务和自行集成,智算团队还有第三种选择。

租用云服务,需要适应供应商的限制;自行集成工具,则要长期承担维护成本。费米集群提供统一的 GPU 调度与运维管理能力,部署在您自己的基础设施上,兼顾国产异构算力与自主可控。

选项一

租用云服务

  • 提示词、模型权重和数据存放在供应商的基础设施上,难以完全自主掌控
  • token 单价由供应商制定,费用受其价格调整影响
  • 功能更新、接口停用和可用区域都受供应商安排限制
  • 合规要求需要与供应商逐项协商落实
上手快,但自主控制有限。
选项二

自行集成多个开源工具

  • JupyterHub + 训练工具 + 模型仓库 + 网关 + 仪表盘……
  • 身份认证、配额管理和审计需要团队自行集成并长期维护
  • 升级时需要重新验证集成,功能缺口和故障由团队自行处理
  • 平台团队还需承担产品开发工作,增加人员和预算压力
软件免费,集成与维护仍需投入。
第三种选择

费米集群 — 统一调度,自主可控

  • 整合计算、存储、网络资源,实现算力统一调度与运维管理
  • 支持国产 CPU(X86 / C86 / ARM)与昇腾、寒武纪、海光、燧原、沐曦、登临等加速卡
  • 适配 Ubuntu、CentOS 及银河麒麟、欧拉等国产操作系统,组件达到自主可控要求
  • 可作为大模型、具身智能与智算云的底层基座,支持跨域异构协同调度
上海市高新技术成果转化项目认定产品。
§ 02 — 使用示例

登录控制台,就能用上算力。

日常路径在浏览器里完成:选资源池、开开发环境或提交作业,再到费用中心核对算力点。已有 Slurm 脚本可继续用 sbatch。

开发环境 →

选池开机,浏览器进入终端

  控制台
# 在费米集群控制台
1. 打开「开发环境」→ 新建
2. 选择资源池、镜像与 GPU 规格
3. 开机(资源不足时可排队)
4. 打开 Web 终端进入容器 Shell

$ nvidia-smi
GPU 0: ...
# 用完关机,卡回到资源池;需要固化时保存镜像

平台管算力生命周期与 Web 终端;IDE 与框架由所选镜像提供。批处理训练请走作业通道。

训练与作业 →

容器走 Volcano,脚本走 Slurm

  作业
# 容器作业
1. 控制台 → 作业 / 队列
2. 选资源池、镜像、规格并提交
3. 排队不计费;分配后查看日志

# 已有 HPC 脚本
$ sbatch train.slurm
# 与容器作业分池,同一套账号与出账

调试用开发环境,批处理用作业。Volcano 与 Slurm 物理分池,费用中心统一看消耗。

计费中心 →

排队不计费,分配后出账

  费用中心
# 计费边界
开发环境:关机不计 GPU 时长;开机占用按量小时
作业:排队不计费;分配到卡后按分配时段计量
Slurm:依据分配事实计入
存储:按卷容量(GiB)计量

→ 费用中心查看算力点、订单与明细

私有化可按内部核算运行。登录称「账号」,计费称「账户」,对外统一「算力点」。

存储与镜像 →

数据进卷,环境进镜像

  存储 / 镜像
# 存储
1. 创建存储卷并挂到开发环境
2. 关机后卷上数据仍保留

# 镜像
3. 选用模板镜像,或从镜像源导入
4. 环境稳定后保存镜像,下次作业直接选用
# 模型权重与数据集在「模型服务」登记

卷放数据,镜像放运行时。开环境或提交作业时直接选用,不必另接外部协议客户端。

能力都挂在同一套控制台上。
共用登录、资源池与出账口径,按角色看到开发或管理视图。
Keycloak
资源池
开发环境
Volcano
Slurm
镜像
存储卷
模型服务
算力点
用户组
角色
私有化
§ 03 — 产品能力

一个产品:费米集群。六项能力。

费米集群提供统一控制台,覆盖开发、作业、模型、存储镜像与计费,共用账号、资源池与出账口径。

费米集群能力矩阵

从登录、开通算力到提交作业与查看费用,日常路径都在同一套界面里完成。

费米集群正式版

一套私有化 GPU 算力平台:统一控制台、资源池、权限与交付。

了解更多 →
开发环境正式版

在 GPU 资源池上自助开通容器,调试完可关机,卡回到池里。

了解更多 →
训练与作业正式版

Volcano 管容器作业,Slurm 管 HPC 脚本;分池调度,统一出账。

了解更多 →
模型服务正式版

集群内模型、数据集与微调入口;推理能力标注建设中。

了解更多 →
存储与镜像正式版

存储卷保住数据,镜像固化环境;开发和作业都从这里取。

了解更多 →
计费中心正式版

按资源分配事实计量;排队不计费;算力点与流水可读。

了解更多 →
查看全部版本
§ 04 — 自主可控

统一调度,国产异构可落地。

费米集群面向智算中心、科研机构与行业客户,在资源调度、权限鉴权与容灾备份等方面形成完整闭环,支撑敏感数据留在自有环境。

01

计算 · 存储 · 网络一体调度

计算模块精细调度资源池,存储模块保障数据安全,网络模块搭建高速通道,实现算力及相关资源的统一调度与运维管理。

02

用户管理与服务鉴权

完善的权限与服务鉴权提供个性化服务,确保数据与操作安全;并配套数据标注、容灾备份等能力,全方位守护用户资产。

03

国产异构与自主可控

支持跨域异构算力协同调度与混合训练全流程适配;组件达到自主可控要求,可部署于自有数据中心、VPC 或物理隔离环境。

§ 05 — 适用团队

面向智算研发与平台运维团队。

费米集群适用于互联网、金融、医疗、教育、科研等行业,以及需要国产异构算力与数据自主可控的机构,为大模型研发与行业智能化提供支撑。

01

AI 研究团队

从 Notebook 到训练任务,全程留在同一平台

为研究人员提供配备 GPU 的开发环境和可查看实时进度的训练模板,支持从实验到生产部署的完整流程,并统一管理身份与配额。

查看详情 →
02

AI 产品团队

在自有基础设施上开发和部署大模型应用

部署兼容 OpenAI 与 Anthropic 的推理接口,托管微调模型,并在专属算力上按 token 计量,便于管理成本、延迟和数据隐私。

查看详情 →
03

平台与基础设施团队

建设统一的内部 AI 平台,减少从零开发的投入

费米集群提供多租户管理、访问策略和监控功能,帮助平台团队将 GPU 集群建设成全公司可用的智算服务平台。

查看详情 →
04

合规与本地部署

在自有环境中部署 AI,落实合规要求

费米集群支持部署到自有数据中心、VPC 或物理隔离环境,并接入现有身份提供方(IdP)、网络策略和国产/通用硬件。

查看详情 →

在自有环境中部署费米集群

自有硬件,统一调度,数据自主掌控。
无论联网还是完全物理隔离,都能搭建可用的智算集群基座。了解各模块功能与协作方式,选择适合您环境的部署方案。