满足不同团队的需求。共用一套智算基座。

费米集群为 AI 研究、产品开发和平台运维提供统一的 GPU 调度与运维能力。了解各类团队如何使用费米集群开展工作。

01 / 04

AI 研究团队

从 Notebook 到训练任务,全程留在同一平台

为研究人员提供配备 GPU 的开发环境和可查看实时进度的训练模板,支持从实验到生产部署的完整流程,并统一管理身份与配额。

应用价值

  • 研究人员可在数小时内启动微调实验,缩短环境准备时间
  • 提交作业时实时校验配额,运行期间可查看日志、进度、TensorBoard 和 MLflow 记录
  • 中断的训练可从检查点恢复,减少重复计算和 GPU 消耗
  • 现有 Slurm 脚本可在同一集群中运行,共用身份认证和配额体系
  • 研究成果可在同一平台上部署到生产环境,减少迁移与改造工作

相关能力

02 / 04

AI 产品团队

在自有集群上管理模型资产与算力成本

用模型服务登记模型与数据集、发起微调;开发与作业共用资源池;费用中心按分配事实查看算力点。在线推理仍在建设中,敏感数据留在内网。

应用价值

  • 模型、数据集与微调入口在同一门户
  • 开发环境与作业分通道,避免交互式占满训练池
  • 按资源分配计量与出账,费用中心可看算力点流水
  • 数据与算力留在自有环境,满足内网部署要求

相关能力

03 / 04

平台与基础设施团队

建设统一的内部 AI 平台,减少从零开发的投入

费米集群提供多租户管理、访问策略和监控功能,帮助平台团队将 GPU 集群建设成全公司可用的智算服务平台。

应用价值

  • 层级用户组组织成员并授权资源池,角色控制菜单与管理权限
  • Keycloak 单点登录,菜单按角色下发,使用者与管理员同一控制台
  • 统一管理资源池、存储卷与镜像,容量按 GiB 计量
  • 按资源分配出账与算力点流水,便于按用户与用户组归属
  • 用户自助开环境与提交作业,管理员管资源池边界与授权
  • 同一产品覆盖开发、作业、模型资产与计费

相关能力

04 / 04

合规与本地部署

在自有环境中部署 AI,落实合规要求

费米集群支持部署到自有数据中心、VPC 或物理隔离环境,并接入现有身份提供方(IdP)、网络策略和国产/通用硬件。

应用价值

  • 专有云 / 内网私有化交付,数据不出域
  • 接入 Keycloak / 客户 IdP,组织与配额在控制台治理
  • 按能力清单验收:控制台、开发、作业、镜像、存储、计费
  • 内部核算模式可无外部支付渠道运行

相关能力