容器管理系统使用文档
快速开始
容器管理系统负责纳管 Kubernetes 集群,将容器资源商品化并提供镜像市场运营能力,是连接业务经营与底层容器编排的中间层。本章说明如何登录系统并理解整体架构。
系统登录
- 访问管理端。使用交付时提供的地址(通常形如
https://k8s.您的域名.com)打开登录页,输入管理员账号与临时密码。 - 完成首次设置。首次登录需修改密码;建议同时在"系统 → 安全设置"中限制管理端的访问来源 IP,只允许办公网与运维跳板机访问。
- 熟悉主界面。左侧菜单依次为:概览、集群、镜像仓库、镜像市场、容器实例、套餐、弹性伸缩、监控日志、系统设置。概览页展示集群资源使用率、实例总数与运行状态分布、镜像市场部署量与近期告警。
平台架构概览
理解三层关系是使用本系统的前提:
| 层级 | 系统 | 职责 |
|---|---|---|
| 经营层 | 业务系统 | 管理客户、商品与订单,支付成功后向本系统发起开通请求 |
| 调度层 | 容器管理系统(本系统) | 接收开通请求,选择集群与命名空间创建容器实例,回传交付信息;日常提供镜像市场、弹性伸缩、监控日志等能力 |
| 资源层 | K8s 集群 | 实际承载容器运行的 Kubernetes 集群,本系统通过 K8s API 对其下发编排指令 |
运维人员日常只需操作本系统,不必直接使用 kubectl 或登录集群节点;业务人员则只需操作业务系统。所有跨系统动作由接口自动完成。
集群接入
集群接入是使用本系统的第一步,完成后系统才能看到并调度您的 K8s 资源。
添加 K8s 集群
- 准备接入凭证。支持两种方式:上传 kubeconfig 文件,或填写 API Server 地址加 ServiceAccount Token。建议为对接创建专用的 ServiceAccount,授予命名空间管理、工作负载管理与节点查看权限,不建议直接使用 cluster-admin 全量权限的个人凭证。
- 添加集群。进入"集群 → 集群列表",点击"添加集群",填写集群名称,选择凭证方式并上传 kubeconfig 或填写 API 地址与 Token,选择是否校验证书。
- 连通性测试。点击"测试连接",系统会验证凭证并读取集群版本、节点列表与可用存储类,测试通过后保存,集群状态显示为"在线"。
纳管已有的外部 K8s 集群
本系统不要求新建集群,已在生产运行的标准 Kubernetes 集群可直接纳管:凡兼容社区标准 API 的集群均可接入,不锁定任何发行版;不同版本、不同发行版的多套异构集群可同时接入、统一管理,套餐可指定落在其中任意集群。纳管过程仅通过标准 K8s API 读写资源对象,不替换、不修改集群自身组件,集群上已有的业务负载不受影响。接入后建议把存量业务所在的命名空间标记为"系统保留",与售卖资源池隔离,避免被自动开通调度占用。
节点纳管
集群添加成功后,其下所有节点自动出现在"集群 → 节点管理"中。对每个节点可以设置:是否参与自动开通调度(维护中的节点可临时关闭)、节点标签(如区分高主频节点、大内存节点,供套餐调度使用)、以及保留资源水位(如 CPU 保留 10%,避免节点被塞满影响系统组件)。节点详情页展示实时负载、已分配额度与运行中的实例清单。
资源池与命名空间规划
"集群 → 资源池"以集群为单位汇总可分配容量:CPU 总核数与已分配请求量、内存、各存储类的容量与余量。自动开通时系统按此数据判断容量是否充足,建议每周关注一次余量,提前扩容。
命名空间是租户隔离的基本单位,系统默认按"一个租户一个(或一组)命名空间"自动创建与管理,并自动附加配额与网络隔离策略。平台自用的命名空间(如监控组件、镜像仓库)可在"集群 → 命名空间"中标记为"系统保留",避免被误纳入售卖资源池。
镜像仓库管理
本系统内置私有镜像仓库(Registry)能力,为平台与每个租户提供独立的镜像存放空间,是镜像市场与实例开通的基础设施。
私有仓库开通
- 平台仓库初始化。进入"镜像仓库 → 仓库设置",确认仓库访问域名(如
registry.您的域名.com)、存储后端与容量上限,交付时通常已完成初始化,此处主要用于核对。 - 租户仓库开通。租户仓库可随租户开通自动创建,也可在"镜像仓库 → 租户仓库"中手动开通,为指定租户分配独立的仓库空间与容量配额(如 20 GB)。
- 下发访问凭证。开通后系统为租户生成仓库账号与访问凭证,租户在自助面板可查看并重置。租户之间仓库完全隔离,互相不可见。
镜像推送与拉取
租户使用标准 Docker 命令即可操作自己的仓库:先执行 docker login registry.您的域名.com 登录,再通过 docker push 推送、docker pull 拉取镜像,镜像路径格式为 registry.域名/租户空间/镜像名:标签。推送成功的镜像会实时出现在管理端与租户面板的镜像列表中,创建容器实例时可直接选用。管理端可查看各租户仓库的用量、镜像数与最近推送记录。
版本与标签管理
镜像列表按"镜像名 → 标签"两级展示,每个标签记录大小、推送时间与摘要(digest)。支持删除指定标签回收空间、将某个标签标记为"默认版本"(创建实例时默认选中)。仓库空间接近配额上限时系统会通知租户清理,也可由管理员在"仓库设置"中开启"自动清理策略",按规则保留最近 N 个版本。
v1.2.0)而非一律使用 latest:实例重建时按固定标签拉取,可避免"重建后应用版本悄悄变了"的问题。镜像市场运营
镜像市场是面向全体客户的镜像与应用模板货架,您可以在官方内容的基础上运营自己的镜像生态,支持免费与付费两种模式。
官方镜像库使用
系统内置官方基础镜像库,覆盖操作系统(Ubuntu、Debian、Alpine 等)、运行时(Node.js、Python、Java、PHP、Go 等)、数据库(MySQL、PostgreSQL、Redis、MongoDB 等)与常用中间件(Nginx、RabbitMQ、Kafka 等)。在"镜像市场 → 官方镜像"中可对每个镜像执行启用/停用,只有启用的镜像才会出现在客户的可选范围。官方库支持在线同步更新,建议每月执行一次同步,获取新版本与安全修复。
应用模板上架流程
- 创建模板。进入"镜像市场 → 应用模板",点击"新建模板",填写模板名称(如"WordPress 建站环境")、简介、分类与图标。
- 编排内容。指定模板包含的镜像组合(如 WordPress + MySQL)、各组件的默认规格、持久化卷、端口与环境变量;支持定义安装参数表单(如站点名称、管理员密码),客户部署时填写。
- 测试部署。点击"测试部署",系统在测试命名空间按模板拉起一套实例,验证可用后再进入上架环节。
- 提交上架。选择免费或付费(付费需设置价格,见下文),提交后进入审核队列。
镜像审核与分类
"镜像市场 → 上架审核"集中处理待审内容,包括平台自建模板与(如开放)租户提交的镜像。审核要点:镜像可正常启动、无恶意内容、描述与实际功能一致、付费定价合理。审核通过后选择分类(建站、数据库、开发环境、中间件等)上架;驳回时需填写原因,提交方可修改后重新提交。已上架内容可随时下架,已部署的实例不受影响。
定价设置
付费镜像/模板在上架时设置计价方式:一次性买断(客户购买后永久可用)或随实例按周期加价(如每月 +10 元)。价格信息同步到业务系统,客户下单时自动并入订单金额,结算与分成记录可在业务系统财务报表中查看。免费内容可用于引流,热门场景(如高可用数据库模板)适合做成付费精品。
容器实例生命周期
本章覆盖容器实例从创建到删除回收的全部管理操作。多数操作既可由运维在管理端执行,也开放给客户在自助面板执行。
创建实例
- 发起创建。进入"容器实例 → 实例列表",点击"创建实例",选择集群(或选"自动调度"由系统挑选资源充足的集群与节点)与归属租户。
- 选择规格与镜像。可直接套用已定义的套餐,或自定义 CPU、内存、存储;镜像可从镜像市场、租户私有仓库中选择,并指定版本标签。
- 配置存储与网络。按需挂载持久化卷(设置容量与挂载路径)、配置端口映射与环境变量。
- 确认创建。提交后可在任务中心查看进度,镜像拉取完成、健康检查通过后实例变为"运行中",详情页显示访问地址与连接信息。
启停与重建
在实例列表或详情页可执行停止、启动、重启。重建用于镜像更新或实例异常的场景:系统销毁当前容器并按原配置重新拉起,持久化卷中的数据保留,容器内未挂载到持久卷的临时数据会丢失。重建时可同时选择新的镜像版本,常用于应用升级。批量操作支持勾选多个实例统一执行。
规格变更
在实例详情点击"规格变更",可调整 CPU、内存与存储容量。CPU/内存变更通过滚动重建生效,单副本实例会有短暂中断;存储卷支持在线扩容、不支持缩容。规格变更与业务系统联动:客户在门户发起升级配置,支付差价后自动执行变更。
删除与回收
删除操作会移除实例及其工作负载,释放配额。持久化卷默认随实例进入回收站,保留期(默认 24 小时,可配置)内可连数据一起恢复,超期后彻底删除。已关联有效订单的实例无法直接删除,需先在业务系统终止订单或走资源回收流程;到期未续费的实例由系统按"到期暂停 → 保留期 → 自动回收"的策略自动处理。
套餐与自动开通
套餐是容器资源的标准化封装,与业务系统的商品绑定后,即可实现客户下单、自动开通容器实例的全自动交付。
套餐定义
- 创建套餐。进入"套餐 → 套餐管理",点击"新建套餐",填写套餐名称(建议含规格,如
2C4G-40G)。 - 定义资源规格。设置 CPU、内存、持久化存储容量、默认副本数,并选择可用镜像范围(全部市场镜像,或限定部分分类)。
- 设置调度范围与增值项。指定套餐可落在哪些集群与节点标签(如数据库套餐只落在本地 SSD 节点);按需勾选是否允许自动伸缩、是否包含私有仓库空间等增值能力。
与业务系统商品绑定
在业务系统的商品配置中,容器类商品通过"资源关联"选择本系统与对应套餐(操作见业务系统文档"商品配置"章节)。本系统侧可在"套餐 → 绑定关系"中查看每个套餐被哪些商品引用,避免误删仍在售卖的套餐。计费模式在商品侧选择:按周期(月付/年付)或按量计费(按实际运行时长与用量出账),两种模式均自动出账。
下单自动开通链路说明
客户在业务系统完成支付后,自动开通按以下链路执行,通常在 1 分钟内完成:
- 接收请求。业务系统携带套餐、镜像、订单信息调用本系统开通接口,本系统在"任务中心"生成开通任务。
- 资源调度。按套餐调度范围选择容量充足的集群,定位(或创建)租户命名空间并校验配额。
- 创建与初始化。创建持久化卷、拉取镜像、启动容器,配置端口映射与域名,等待健康检查通过。
- 回传交付信息。将访问地址、连接信息回传业务系统,订单变为"已开通",客户收到开通通知。
任一环节失败,任务标记为异常并通知管理员,业务系统侧订单进入"开通异常"状态,排障后可从失败步骤重试。
GPU 容器实例
GPU 容器实例把 GPU 算力以容器形态切分出租:显存按 MB 粒度精细划分,一张物理卡可同时服务多个租户,面向 AI 推理、模型训练、渲染等智算业务售卖。本章说明从 GPU 资源池配置、显存切分规格定义到 GPU 容器创建与监控的完整流程。
GPU 资源池配置
集群接入后,系统自动识别各节点上的 GPU 卡,读取型号、显存容量与在位数量,汇总到"集群 → GPU 资源池"。不同型号的 GPU 可异构混部、统一纳管,系统默认按型号自动分池(如推理卡池、训练卡池),也可手动划分并为池打标签,供套餐调度使用。对每张卡可以设置:是否参与售卖(自用或维护中的卡可临时下架)、切分模式(整卡直通或显存切分)。资源池页面实时展示每张卡的分配情况与余量,自动开通时按此数据判断容量是否充足。
显存切分规格定义
- 开启切分模式。在"GPU 资源池"中选择目标卡型,将切分模式设为"显存切分"。整卡直通模式的卡不参与切分,适合售卖独享整卡的高价值订单。
- 定义切分规格。进入"GPU 资源池 → 切分规格",为该卡型创建规格:填写显存大小(MB 粒度,如 4096 MB、8192 MB)与算力配比(如整卡算力的 1/6),同一张卡上可组合多种规格,只要显存总和不超过物理容量。
- 校验与生效。保存后系统校验规格组合的可行性并在对应节点下发切分配置,已在运行的 GPU 实例不受影响,新规格即刻可用于创建实例。
- 绑定套餐售卖。在"套餐 → 套餐管理"中新建 GPU 套餐,选择卡型与切分规格,再到业务系统绑定商品上架,即可实现客户下单、GPU 容器自动开通。
创建 GPU 容器
创建入口与普通容器实例一致:在"容器实例 → 创建实例"中选择 GPU 套餐(或自定义时勾选"GPU 资源"并选择卡型与切分规格),系统自动调度到有余量的 GPU 节点,完成显存配额下发、GPU 设备挂载与运行时注入,租户在容器内即可直接使用分配到的 GPU 资源。同一租户多个 GPU 实例可分布在不同卡、不同节点上,租户之间显存与算力严格隔离、互不可见。镜像建议选用镜像市场中预装 CUDA、常用推理/训练框架的官方 AI 镜像,开箱即用。
监控 GPU 利用率
"监控日志 → GPU 监控"提供三级视图:按卡查看利用率、显存占用、温度与功耗;按实例查看该容器分配的显存用量与算力占用曲线;按租户汇总 GPU 资源消耗,作为按量计费与容量规划的依据。实例级 GPU 监控同步展示在客户自助面板。建议配置两条告警规则:单卡温度或功耗持续过高(提示散热或超载问题)、GPU 池整体分配率超过 85%(提示扩容窗口),确保智算业务的可用性与可持续售卖。
存储与网络
存储决定客户数据是否安全持久,网络决定实例如何被访问、租户之间是否隔离。本章说明两者的配置要点。
持久化卷挂载
- 确认存储类。集群接入时系统自动读取可用存储类(StorageClass),在"集群 → 存储配置"中为其标注用途与是否对售卖开放。
- 挂载卷。创建实例或在实例详情的"存储"页签中添加持久化卷,设置容量与容器内挂载路径(如
/var/lib/mysql)。写入挂载路径的数据独立于容器存在,实例重启、重建均保留。 - 扩容。卷支持在线扩容:调整容量后由存储后端自动完成,无需停止实例;不支持缩容。
端口映射与域名绑定
端口映射把容器端口暴露为外部可访问的地址:在实例的"网络"页签添加映射,选择协议(TCP/UDP)与容器端口,系统从端口池自动分配外部端口,也可由管理员手动指定。Web 类应用推荐使用域名绑定:填写客户域名并指向容器端口,系统自动配置入口路由与转发,支持上传证书启用 HTTPS。客户侧只需将域名解析到平台提供的接入地址即可生效。
网络隔离说明
系统默认按租户下发网络隔离策略:同一租户的实例之间内网互通(便于应用与数据库组网),不同租户之间网络完全隔离,任何跨租户访问均被拦截。平台系统组件(监控、日志采集)通过白名单访问各租户实例。隔离策略由系统自动维护,无需也不建议手工修改集群网络策略。
弹性伸缩
弹性伸缩让实例的副本数量跟随负载变化,业务高峰自动扩容、低谷自动回收,是容器业务相对虚拟机的核心优势之一。
手动扩缩容
在实例详情点击"扩缩容",直接调整副本数量,确认后系统在数十秒内完成新副本创建或多余副本回收,过程中已有副本持续提供服务。手动方式适合可预期的负载变化,例如客户提前告知的活动扩容。多副本实例的流量由系统自动负载均衡到各副本,无需额外配置。
自动伸缩策略配置
- 启用自动伸缩。在实例详情的"弹性伸缩"页签开启自动伸缩(需套餐允许该能力)。
- 设置触发条件。选择指标(CPU 使用率、内存使用率)与目标值,例如"CPU 平均使用率超过 70% 时扩容"。
- 设置副本上下限。如最小 2 副本、最大 8 副本。上限用于防止异常流量或死循环把配额与费用打爆,下限保证基本服务能力。
- 观察伸缩记录。"伸缩记录"页签展示每次扩缩的时间、原因与副本变化,用于回顾策略是否合理。
按量计费的实例,副本数变化会如实反映在账单中;周期计费套餐的可伸缩范围由套餐定义约定。
监控与日志
监控日志模块覆盖集群、节点与实例三级,配合 Web 终端,绝大多数排障工作可以在网页内完成。
监控指标
| 层级 | 主要指标 | 典型用途 |
|---|---|---|
| 集群 / 节点 | CPU 使用率、内存使用率、存储容量、Pod 密度 | 容量规划、发现节点瓶颈 |
| 容器实例 | CPU、内存、网络流量、重启次数、副本状态 | 定位客户应用异常、发现资源滥用 |
| 平台任务 | 开通成功率、镜像拉取耗时、接口响应耗时 | 评估平台自身健康度 |
各层级提供近 1 小时到近 30 天的趋势图,实例监控数据同步展示在客户自助面板中。告警规则在"监控日志 → 告警规则"中配置,建议至少覆盖:节点高水位、存储余量不足、实例反复重启、自动开通失败、镜像仓库容量不足五条基础规则,通知渠道支持邮件、短信与 Webhook(可接入企业微信、钉钉)。
日志查看
在实例详情的"日志"页签在线查看容器标准输出日志,支持按副本切换、关键字过滤、按时间范围检索与下载。日志默认保留 7 天(可在系统设置中调整保留期与存储配额)。实例异常退出时,系统会保留上一个容器的日志,方便定位崩溃原因——这是排查"容器反复重启"最常用的入口。
Web 终端使用
在实例详情点击"Web 终端",浏览器内直接打开容器的命令行会话,无需安装 kubectl 或申请集群凭证,多副本实例可选择进入指定副本。终端会话全程记录审计日志,可在"操作记录"中回放追溯。管理员可在"系统设置 → 自助权限"中控制是否向租户开放 Web 终端,以及按套餐差异化开放。
常见问题
镜像拉取失败,如何排查?
实例一直处于"创建中"怎么办?
持久化卷数据在实例重建后是否保留?
/var/lib/mysql)的数据才受保护,容器内其他目录属于临时层,重建即清空。如果客户反馈"重建后数据没了",大概率是应用的数据目录没有挂载到持久卷上,调整挂载路径后重新部署即可避免。