容器管理系统使用文档

适用角色:容器/应用运维 · 平台管理员 · 最近更新:2026-07

快速开始

容器管理系统负责纳管 Kubernetes 集群,将容器资源商品化并提供镜像市场运营能力,是连接业务经营与底层容器编排的中间层。本章说明如何登录系统并理解整体架构。

系统登录

  1. 访问管理端。使用交付时提供的地址(通常形如 https://k8s.您的域名.com)打开登录页,输入管理员账号与临时密码。
  2. 完成首次设置。首次登录需修改密码;建议同时在"系统 → 安全设置"中限制管理端的访问来源 IP,只允许办公网与运维跳板机访问。
  3. 熟悉主界面。左侧菜单依次为:概览、集群、镜像仓库、镜像市场、容器实例、套餐、弹性伸缩、监控日志、系统设置。概览页展示集群资源使用率、实例总数与运行状态分布、镜像市场部署量与近期告警。

平台架构概览

理解三层关系是使用本系统的前提:

层级系统职责
经营层业务系统管理客户、商品与订单,支付成功后向本系统发起开通请求
调度层容器管理系统(本系统)接收开通请求,选择集群与命名空间创建容器实例,回传交付信息;日常提供镜像市场、弹性伸缩、监控日志等能力
资源层K8s 集群实际承载容器运行的 Kubernetes 集群,本系统通过 K8s API 对其下发编排指令

运维人员日常只需操作本系统,不必直接使用 kubectl 或登录集群节点;业务人员则只需操作业务系统。所有跨系统动作由接口自动完成。

建议保留 kubectl 的直连能力仅用于故障排查,日常实例创建、扩缩容等操作统一走本系统,以保证操作记录与资源台账一致。

集群接入

集群接入是使用本系统的第一步,完成后系统才能看到并调度您的 K8s 资源。

添加 K8s 集群

  1. 准备接入凭证。支持两种方式:上传 kubeconfig 文件,或填写 API Server 地址加 ServiceAccount Token。建议为对接创建专用的 ServiceAccount,授予命名空间管理、工作负载管理与节点查看权限,不建议直接使用 cluster-admin 全量权限的个人凭证。
  2. 添加集群。进入"集群 → 集群列表",点击"添加集群",填写集群名称,选择凭证方式并上传 kubeconfig 或填写 API 地址与 Token,选择是否校验证书。
  3. 连通性测试。点击"测试连接",系统会验证凭证并读取集群版本、节点列表与可用存储类,测试通过后保存,集群状态显示为"在线"。

纳管已有的外部 K8s 集群

本系统不要求新建集群,已在生产运行的标准 Kubernetes 集群可直接纳管:凡兼容社区标准 API 的集群均可接入,不锁定任何发行版;不同版本、不同发行版的多套异构集群可同时接入、统一管理,套餐可指定落在其中任意集群。纳管过程仅通过标准 K8s API 读写资源对象,不替换、不修改集群自身组件,集群上已有的业务负载不受影响。接入后建议把存量业务所在的命名空间标记为"系统保留",与售卖资源池隔离,避免被自动开通调度占用。

节点纳管

集群添加成功后,其下所有节点自动出现在"集群 → 节点管理"中。对每个节点可以设置:是否参与自动开通调度(维护中的节点可临时关闭)、节点标签(如区分高主频节点、大内存节点,供套餐调度使用)、以及保留资源水位(如 CPU 保留 10%,避免节点被塞满影响系统组件)。节点详情页展示实时负载、已分配额度与运行中的实例清单。

资源池与命名空间规划

"集群 → 资源池"以集群为单位汇总可分配容量:CPU 总核数与已分配请求量、内存、各存储类的容量与余量。自动开通时系统按此数据判断容量是否充足,建议每周关注一次余量,提前扩容。

命名空间是租户隔离的基本单位,系统默认按"一个租户一个(或一组)命名空间"自动创建与管理,并自动附加配额与网络隔离策略。平台自用的命名空间(如监控组件、镜像仓库)可在"集群 → 命名空间"中标记为"系统保留",避免被误纳入售卖资源池。

不要在 K8s 侧手动删除由本系统创建的命名空间或工作负载,否则会造成台账与实际资源不一致;确需清理时请在本系统内执行删除操作。

镜像仓库管理

本系统内置私有镜像仓库(Registry)能力,为平台与每个租户提供独立的镜像存放空间,是镜像市场与实例开通的基础设施。

私有仓库开通

  1. 平台仓库初始化。进入"镜像仓库 → 仓库设置",确认仓库访问域名(如 registry.您的域名.com)、存储后端与容量上限,交付时通常已完成初始化,此处主要用于核对。
  2. 租户仓库开通。租户仓库可随租户开通自动创建,也可在"镜像仓库 → 租户仓库"中手动开通,为指定租户分配独立的仓库空间与容量配额(如 20 GB)。
  3. 下发访问凭证。开通后系统为租户生成仓库账号与访问凭证,租户在自助面板可查看并重置。租户之间仓库完全隔离,互相不可见。

镜像推送与拉取

租户使用标准 Docker 命令即可操作自己的仓库:先执行 docker login registry.您的域名.com 登录,再通过 docker push 推送、docker pull 拉取镜像,镜像路径格式为 registry.域名/租户空间/镜像名:标签。推送成功的镜像会实时出现在管理端与租户面板的镜像列表中,创建容器实例时可直接选用。管理端可查看各租户仓库的用量、镜像数与最近推送记录。

版本与标签管理

镜像列表按"镜像名 → 标签"两级展示,每个标签记录大小、推送时间与摘要(digest)。支持删除指定标签回收空间、将某个标签标记为"默认版本"(创建实例时默认选中)。仓库空间接近配额上限时系统会通知租户清理,也可由管理员在"仓库设置"中开启"自动清理策略",按规则保留最近 N 个版本。

建议引导租户使用语义化版本标签(如 v1.2.0)而非一律使用 latest:实例重建时按固定标签拉取,可避免"重建后应用版本悄悄变了"的问题。

镜像市场运营

镜像市场是面向全体客户的镜像与应用模板货架,您可以在官方内容的基础上运营自己的镜像生态,支持免费与付费两种模式。

官方镜像库使用

系统内置官方基础镜像库,覆盖操作系统(Ubuntu、Debian、Alpine 等)、运行时(Node.js、Python、Java、PHP、Go 等)、数据库(MySQL、PostgreSQL、Redis、MongoDB 等)与常用中间件(Nginx、RabbitMQ、Kafka 等)。在"镜像市场 → 官方镜像"中可对每个镜像执行启用/停用,只有启用的镜像才会出现在客户的可选范围。官方库支持在线同步更新,建议每月执行一次同步,获取新版本与安全修复。

应用模板上架流程

  1. 创建模板。进入"镜像市场 → 应用模板",点击"新建模板",填写模板名称(如"WordPress 建站环境")、简介、分类与图标。
  2. 编排内容。指定模板包含的镜像组合(如 WordPress + MySQL)、各组件的默认规格、持久化卷、端口与环境变量;支持定义安装参数表单(如站点名称、管理员密码),客户部署时填写。
  3. 测试部署。点击"测试部署",系统在测试命名空间按模板拉起一套实例,验证可用后再进入上架环节。
  4. 提交上架。选择免费或付费(付费需设置价格,见下文),提交后进入审核队列。

镜像审核与分类

"镜像市场 → 上架审核"集中处理待审内容,包括平台自建模板与(如开放)租户提交的镜像。审核要点:镜像可正常启动、无恶意内容、描述与实际功能一致、付费定价合理。审核通过后选择分类(建站、数据库、开发环境、中间件等)上架;驳回时需填写原因,提交方可修改后重新提交。已上架内容可随时下架,已部署的实例不受影响。

定价设置

付费镜像/模板在上架时设置计价方式:一次性买断(客户购买后永久可用)或随实例按周期加价(如每月 +10 元)。价格信息同步到业务系统,客户下单时自动并入订单金额,结算与分成记录可在业务系统财务报表中查看。免费内容可用于引流,热门场景(如高可用数据库模板)适合做成付费精品。

运营初期建议先把官方镜像与 3~5 个高频免费模板(建站、常用数据库、开发环境)配齐,让客户"来了就有得用",再逐步补充付费精品模板。

容器实例生命周期

本章覆盖容器实例从创建到删除回收的全部管理操作。多数操作既可由运维在管理端执行,也开放给客户在自助面板执行。

创建实例

  1. 发起创建。进入"容器实例 → 实例列表",点击"创建实例",选择集群(或选"自动调度"由系统挑选资源充足的集群与节点)与归属租户。
  2. 选择规格与镜像。可直接套用已定义的套餐,或自定义 CPU、内存、存储;镜像可从镜像市场、租户私有仓库中选择,并指定版本标签。
  3. 配置存储与网络。按需挂载持久化卷(设置容量与挂载路径)、配置端口映射与环境变量。
  4. 确认创建。提交后可在任务中心查看进度,镜像拉取完成、健康检查通过后实例变为"运行中",详情页显示访问地址与连接信息。

启停与重建

在实例列表或详情页可执行停止、启动、重启。重建用于镜像更新或实例异常的场景:系统销毁当前容器并按原配置重新拉起,持久化卷中的数据保留,容器内未挂载到持久卷的临时数据会丢失。重建时可同时选择新的镜像版本,常用于应用升级。批量操作支持勾选多个实例统一执行。

规格变更

在实例详情点击"规格变更",可调整 CPU、内存与存储容量。CPU/内存变更通过滚动重建生效,单副本实例会有短暂中断;存储卷支持在线扩容、不支持缩容。规格变更与业务系统联动:客户在门户发起升级配置,支付差价后自动执行变更。

删除与回收

删除操作会移除实例及其工作负载,释放配额。持久化卷默认随实例进入回收站,保留期(默认 24 小时,可配置)内可连数据一起恢复,超期后彻底删除。已关联有效订单的实例无法直接删除,需先在业务系统终止订单或走资源回收流程;到期未续费的实例由系统按"到期暂停 → 保留期 → 自动回收"的策略自动处理。

删除实例并超过回收站保留期后,持久化卷数据不可找回。执行删除前请确认客户已备份数据或订单已合规终止。

套餐与自动开通

套餐是容器资源的标准化封装,与业务系统的商品绑定后,即可实现客户下单、自动开通容器实例的全自动交付。

套餐定义

  1. 创建套餐。进入"套餐 → 套餐管理",点击"新建套餐",填写套餐名称(建议含规格,如 2C4G-40G)。
  2. 定义资源规格。设置 CPU、内存、持久化存储容量、默认副本数,并选择可用镜像范围(全部市场镜像,或限定部分分类)。
  3. 设置调度范围与增值项。指定套餐可落在哪些集群与节点标签(如数据库套餐只落在本地 SSD 节点);按需勾选是否允许自动伸缩、是否包含私有仓库空间等增值能力。

与业务系统商品绑定

在业务系统的商品配置中,容器类商品通过"资源关联"选择本系统与对应套餐(操作见业务系统文档"商品配置"章节)。本系统侧可在"套餐 → 绑定关系"中查看每个套餐被哪些商品引用,避免误删仍在售卖的套餐。计费模式在商品侧选择:按周期(月付/年付)或按量计费(按实际运行时长与用量出账),两种模式均自动出账。

下单自动开通链路说明

客户在业务系统完成支付后,自动开通按以下链路执行,通常在 1 分钟内完成:

  1. 接收请求。业务系统携带套餐、镜像、订单信息调用本系统开通接口,本系统在"任务中心"生成开通任务。
  2. 资源调度。按套餐调度范围选择容量充足的集群,定位(或创建)租户命名空间并校验配额。
  3. 创建与初始化。创建持久化卷、拉取镜像、启动容器,配置端口映射与域名,等待健康检查通过。
  4. 回传交付信息。将访问地址、连接信息回传业务系统,订单变为"已开通",客户收到开通通知。

任一环节失败,任务标记为异常并通知管理员,业务系统侧订单进入"开通异常"状态,排障后可从失败步骤重试。

GPU 容器实例

GPU 容器实例把 GPU 算力以容器形态切分出租:显存按 MB 粒度精细划分,一张物理卡可同时服务多个租户,面向 AI 推理、模型训练、渲染等智算业务售卖。本章说明从 GPU 资源池配置、显存切分规格定义到 GPU 容器创建与监控的完整流程。

GPU 资源池配置

集群接入后,系统自动识别各节点上的 GPU 卡,读取型号、显存容量与在位数量,汇总到"集群 → GPU 资源池"。不同型号的 GPU 可异构混部、统一纳管,系统默认按型号自动分池(如推理卡池、训练卡池),也可手动划分并为池打标签,供套餐调度使用。对每张卡可以设置:是否参与售卖(自用或维护中的卡可临时下架)、切分模式(整卡直通或显存切分)。资源池页面实时展示每张卡的分配情况与余量,自动开通时按此数据判断容量是否充足。

显存切分规格定义

  1. 开启切分模式。在"GPU 资源池"中选择目标卡型,将切分模式设为"显存切分"。整卡直通模式的卡不参与切分,适合售卖独享整卡的高价值订单。
  2. 定义切分规格。进入"GPU 资源池 → 切分规格",为该卡型创建规格:填写显存大小(MB 粒度,如 4096 MB、8192 MB)与算力配比(如整卡算力的 1/6),同一张卡上可组合多种规格,只要显存总和不超过物理容量。
  3. 校验与生效。保存后系统校验规格组合的可行性并在对应节点下发切分配置,已在运行的 GPU 实例不受影响,新规格即刻可用于创建实例。
  4. 绑定套餐售卖。在"套餐 → 套餐管理"中新建 GPU 套餐,选择卡型与切分规格,再到业务系统绑定商品上架,即可实现客户下单、GPU 容器自动开通。

创建 GPU 容器

创建入口与普通容器实例一致:在"容器实例 → 创建实例"中选择 GPU 套餐(或自定义时勾选"GPU 资源"并选择卡型与切分规格),系统自动调度到有余量的 GPU 节点,完成显存配额下发、GPU 设备挂载与运行时注入,租户在容器内即可直接使用分配到的 GPU 资源。同一租户多个 GPU 实例可分布在不同卡、不同节点上,租户之间显存与算力严格隔离、互不可见。镜像建议选用镜像市场中预装 CUDA、常用推理/训练框架的官方 AI 镜像,开箱即用。

驱动与运行时说明:GPU 节点需预装对应厂商的显卡驱动(交付时可由我方协助完成),容器内无需也不应再安装驱动;容器运行时与设备插件由系统在集群纳管时自动部署并校验版本兼容性。升级节点驱动前,请先将该节点上的 GPU 卡临时下架,避免影响运行中的实例。

监控 GPU 利用率

"监控日志 → GPU 监控"提供三级视图:按卡查看利用率、显存占用、温度与功耗;按实例查看该容器分配的显存用量与算力占用曲线;按租户汇总 GPU 资源消耗,作为按量计费与容量规划的依据。实例级 GPU 监控同步展示在客户自助面板。建议配置两条告警规则:单卡温度或功耗持续过高(提示散热或超载问题)、GPU 池整体分配率超过 85%(提示扩容窗口),确保智算业务的可用性与可持续售卖。

存储与网络

存储决定客户数据是否安全持久,网络决定实例如何被访问、租户之间是否隔离。本章说明两者的配置要点。

持久化卷挂载

  1. 确认存储类。集群接入时系统自动读取可用存储类(StorageClass),在"集群 → 存储配置"中为其标注用途与是否对售卖开放。
  2. 挂载卷。创建实例或在实例详情的"存储"页签中添加持久化卷,设置容量与容器内挂载路径(如 /var/lib/mysql)。写入挂载路径的数据独立于容器存在,实例重启、重建均保留。
  3. 扩容。卷支持在线扩容:调整容量后由存储后端自动完成,无需停止实例;不支持缩容。
只有写入持久化卷挂载路径的数据才会被保留,容器内其他目录属于临时层,重建即丢失。数据库类应用务必确认数据目录已正确挂载持久卷。

端口映射与域名绑定

端口映射把容器端口暴露为外部可访问的地址:在实例的"网络"页签添加映射,选择协议(TCP/UDP)与容器端口,系统从端口池自动分配外部端口,也可由管理员手动指定。Web 类应用推荐使用域名绑定:填写客户域名并指向容器端口,系统自动配置入口路由与转发,支持上传证书启用 HTTPS。客户侧只需将域名解析到平台提供的接入地址即可生效。

网络隔离说明

系统默认按租户下发网络隔离策略:同一租户的实例之间内网互通(便于应用与数据库组网),不同租户之间网络完全隔离,任何跨租户访问均被拦截。平台系统组件(监控、日志采集)通过白名单访问各租户实例。隔离策略由系统自动维护,无需也不建议手工修改集群网络策略。

弹性伸缩

弹性伸缩让实例的副本数量跟随负载变化,业务高峰自动扩容、低谷自动回收,是容器业务相对虚拟机的核心优势之一。

手动扩缩容

在实例详情点击"扩缩容",直接调整副本数量,确认后系统在数十秒内完成新副本创建或多余副本回收,过程中已有副本持续提供服务。手动方式适合可预期的负载变化,例如客户提前告知的活动扩容。多副本实例的流量由系统自动负载均衡到各副本,无需额外配置。

自动伸缩策略配置

  1. 启用自动伸缩。在实例详情的"弹性伸缩"页签开启自动伸缩(需套餐允许该能力)。
  2. 设置触发条件。选择指标(CPU 使用率、内存使用率)与目标值,例如"CPU 平均使用率超过 70% 时扩容"。
  3. 设置副本上下限。如最小 2 副本、最大 8 副本。上限用于防止异常流量或死循环把配额与费用打爆,下限保证基本服务能力。
  4. 观察伸缩记录。"伸缩记录"页签展示每次扩缩的时间、原因与副本变化,用于回顾策略是否合理。

按量计费的实例,副本数变化会如实反映在账单中;周期计费套餐的可伸缩范围由套餐定义约定。

目标使用率不宜设得过高:设置 70% 左右可为扩容过程(拉起新副本需要数十秒)预留缓冲,避免负载冲顶时新副本还没就绪。

监控与日志

监控日志模块覆盖集群、节点与实例三级,配合 Web 终端,绝大多数排障工作可以在网页内完成。

监控指标

层级主要指标典型用途
集群 / 节点CPU 使用率、内存使用率、存储容量、Pod 密度容量规划、发现节点瓶颈
容器实例CPU、内存、网络流量、重启次数、副本状态定位客户应用异常、发现资源滥用
平台任务开通成功率、镜像拉取耗时、接口响应耗时评估平台自身健康度

各层级提供近 1 小时到近 30 天的趋势图,实例监控数据同步展示在客户自助面板中。告警规则在"监控日志 → 告警规则"中配置,建议至少覆盖:节点高水位、存储余量不足、实例反复重启、自动开通失败、镜像仓库容量不足五条基础规则,通知渠道支持邮件、短信与 Webhook(可接入企业微信、钉钉)。

日志查看

在实例详情的"日志"页签在线查看容器标准输出日志,支持按副本切换、关键字过滤、按时间范围检索与下载。日志默认保留 7 天(可在系统设置中调整保留期与存储配额)。实例异常退出时,系统会保留上一个容器的日志,方便定位崩溃原因——这是排查"容器反复重启"最常用的入口。

Web 终端使用

在实例详情点击"Web 终端",浏览器内直接打开容器的命令行会话,无需安装 kubectl 或申请集群凭证,多副本实例可选择进入指定副本。终端会话全程记录审计日志,可在"操作记录"中回放追溯。管理员可在"系统设置 → 自助权限"中控制是否向租户开放 Web 终端,以及按套餐差异化开放。

建议向租户默认开放日志查看与 Web 终端。经验上,这两项自助能力可以消化大部分"应用起不来、帮忙看一下"类工单。

常见问题

镜像拉取失败,如何排查?
按出现频率排序:① 镜像名或标签写错、标签已被删除——在镜像仓库或镜像市场中确认该标签确实存在;② 私有仓库凭证问题——租户仓库凭证被重置后旧凭证失效,在实例配置中更新凭证;③ 节点磁盘空间不足导致无法拉取——查看节点监控的磁盘余量,清理无用镜像缓存;④ 镜像体积过大拉取超时——建议租户精简镜像(如改用 alpine 基础镜像);⑤ 仓库服务或外网源不可达——在"镜像仓库 → 仓库设置"中检查仓库状态。任务中心的失败日志会标明具体报错信息。
实例一直处于"创建中"怎么办?
先在任务中心查看卡在哪一步:卡在"镜像拉取"参考上一条排查;卡在"存储卷创建"通常是存储类后端容量不足或存储服务异常,检查"集群 → 存储配置"中对应存储类状态;卡在"调度中"说明没有节点满足资源要求,检查资源池余量或该套餐的节点标签范围是否过窄;卡在"健康检查"说明容器已启动但应用未就绪,通过实例日志查看应用启动报错(常见为环境变量缺失、数据库连不上)。处理后可在任务中心从失败步骤重试,长时间无法定位时可删除任务重新发起。
持久化卷数据在实例重建后是否保留?
保留。持久化卷独立于容器存在,重启、重建、规格变更、镜像升级都不会影响卷中数据,只有删除实例并超过回收站保留期后卷才会被彻底删除。需要注意的是:只有写入了卷挂载路径(如 /var/lib/mysql)的数据才受保护,容器内其他目录属于临时层,重建即清空。如果客户反馈"重建后数据没了",大概率是应用的数据目录没有挂载到持久卷上,调整挂载路径后重新部署即可避免。
付费镜像如何结算?
付费镜像/模板的价格在上架时设置,支持一次性买断和随实例周期加价两种计价方式。客户下单时,镜像费用自动并入业务系统的订单金额,与套餐费用一并支付;周期加价类在每期续费账单中体现。所有收入明细可在业务系统的财务报表中按商品维度查询。如果开放租户上架付费镜像,可在"镜像市场 → 分成设置"中配置平台与上架方的分成比例,系统按比例自动记账。
客户超出资源配额会发生什么?
配额在租户维度生效,限制该租户全部实例的 CPU、内存、存储与实例数量总和。达到配额后,新建实例、扩容、增加副本等会使资源超限的操作会被直接拦截,并提示"配额不足",已运行的实例不受影响。自动伸缩策略也受配额约束,扩容到配额上限即停止。客户可在自助面板查看自己的配额使用率;需要提升配额时,通过业务系统购买升级或由管理员在"租户管理"中手动调整。
显存切分后,GPU 性能是否受影响?
显存切分限制的是每个实例可用的显存容量与算力配额,隔离在驱动与运行时层实现,实例在自己的配额范围内运行时,性能与独享同等规格资源基本一致,不会因为"同卡有其他租户"而额外损耗。需要注意两点:① 切分规格决定了任务上限——显存 4G 的规格跑不动需要 10G 显存的模型,应引导客户按模型需求选择规格;② 若开启算力份额弹性共享(空闲算力允许临时借用),高峰期各实例回落到自己的保底配额,属于正常现象。对性能极度敏感的客户,建议售卖整卡直通规格。
GPU 容器支持哪些卡型?
主流数据中心级训练卡与推理卡均可纳管,常见消费级显卡也支持接入(消费级卡建议以整卡直通方式出租)。不同型号、不同代际的 GPU 可异构混部在同一平台内,按型号分池、分别定义切分规格与定价,互不影响。是否支持显存切分与具体切分粒度和卡型、驱动版本相关,接入时系统会自动检测并在 GPU 资源池中标注每张卡支持的模式;选型或采购前可联系我方获取当前版本的兼容卡型清单。
实例反复重启,如何定位原因?
在实例详情查看"重启次数"与最近事件,常见原因有三类:① 应用自身崩溃——查看"日志"页签中上一个容器的退出日志,通常能看到报错堆栈;② 内存超限被终止——监控曲线中内存触顶后实例重启,说明套餐内存不够,建议客户升级规格或优化应用;③ 健康检查配置不当——应用启动慢于健康检查等待时间,被误判为异常反复重启,可在实例配置中调大启动等待时间。定位期间可先手动停止实例,避免反复拉起干扰排查。