--- theme: frankfurt title: XINFRA 平台架构 author: 实训小组 infoLine: true transition: slide-left mdc: true drawings: persist: false --- # XINFRA 平台架构
统一基础设施管理平台 · 总体架构设计
实训小组
--- layout: default --- # 目录
### 一、名词概述 - 组内约定 - 通用术语
### 二、架构图 - 平台分层架构 - 部署架构 - 监控告警链路 - 安全认证流程
### 三、架构描述 - 技术选型 - 数据库设计 - 安全机制 - 运维模型与风险
--- section: 名词概述 layout: center --- # 一、名词概述
平台核心概念与通用术语
--- layout: default --- # 组内约定
### 主系统 XINFRA 平台自身的统管层,负责子系统无法覆盖的能力: - 统一门户(SSO 跳转入口) - 资源大盘、运维终端 - 登录审计与运维操作审计 - 资源指标面板
### 子系统 XINFRA 纳管的专项平台(独立 WebUI + API): - **Wayne** — 多集群容器管理 - **CloudDM** — 数据库管理与 SQL 审核 - **CacheCloud** — Redis 缓存管理 - **Apollo** — 配置中心 - **Grafana** — 监控可视化 - **qpass** — 统一告警与值班通知
### 工具层 纳管的 CLI / IaC 工具,无常驻 WebUI: - **Ansible Playbook** — 自动化部署与基础设施即代码
### 监控告警层 聚合异构告警源,统一去重、收敛、分级: - **Nightingale(夜莺)** — 告警聚合引擎 - **VictoriaMetrics** — 容器/业务指标存储 - **Zabbix** — 物理机硬件监控
--- # 通用术语(一)
| 术语 | 说明 | |------|------| | **APIKey** | Wayne 对外 API 认证密钥,CI/CD 自动化场景使用,最小权限 | | **RBAC** | 基于角色的访问控制,用户与角色关联实现权限隔离 | | **RKE2** | Rancher K8s 发行版,CIS 安全加固,支持离线安装 | | **Calico BGP** | 纯路由模式无隧道开销,每集群独立 AS 号,跨机房扁平网络 | | **Ceph RBD** | 分布式块存储,供给 K8s PV 给有状态服务 | | **Nightingale** | 夜莺,统一告警聚合引擎,去重收敛分级后推送 | | **Apollo** | 携程开源配置中心,多机房部署、灰度、回滚、审计 |
| 术语 | 说明 | |------|------| | **Consul** | 各机房服务注册发现,XINFRA 只读聚合展示 | | **CD** | 持续部署,自动化服务上线流水线 | | **WAF** | Web 应用防火墙,防护 SQL 注入、XSS、CSRF | | **SLA** | 服务等级协议,定义可用性承诺指标 | | **IaC** | 基础设施即代码,通过 Ansible 实现自动化管理 | | **SINA CMDB** | 公司内部 CMDB,物理机与虚机资产数据基础来源 | | **SSO** | 单点登录,主系统通过 LDAP 统一认证后跳转子系统 |
--- section: 架构图 layout: center --- # 二、架构图
平台分层 · 部署 · 监控 · 安全
--- # 平台分层架构 — 总体分层
```mermaid graph TB User["用户层
LDAP SSO 统一认证"] --> Main["主系统层
统一门户 + 功能模块"] Main --> Sub["子系统层
独立部署,各自授权"] Main --> Infra["基础设施层
计算 · 网络 · 存储 · 自动化"] Sub --> Infra style User fill:#f3e8fd,stroke:#9333ea style Main fill:#e0f2fe,stroke:#0284c7 style Sub fill:#e8f0fe,stroke:#4285f4 style Infra fill:#ecfdf5,stroke:#059669 ```
> 四层模型:用户层 → 主系统层 → 子系统层 → 基础设施层,主系统是统一入口,子系统各司其职。
--- # 平台分层架构 — 主系统功能
```mermaid graph TB Portal["统一门户
LDAP SSO 跳转入口"] subgraph 全局视图 DashBoard["资源大盘
集群拓扑 · 节点方格图"] MonitorView["资源状态看板
物理机/虚机/服务三层告警"] end subgraph 运维能力 TaskCenter["任务中心
Ansible/Wayne 实时日志"] OpsTerminal["运维终端
Ansible / SSH
仅管理员"] end subgraph 治理能力 AuditDash["审计面板
登录记录 · 运维操作日志"] CMDB["资源台账
CMDB 多云同步"] SvcDir["服务目录
Consul 只读聚合"] end Portal --> DashBoard & MonitorView & TaskCenter & AuditDash & CMDB & SvcDir ```
> 主系统不替代子系统,只自建子系统无法覆盖的能力:全局视图、运维兜底、审计、资源台账。
--- # 平台分层架构 — 子系统集成
```mermaid graph LR Portal["XINFRA 主系统"] subgraph 子系统 Wayne["Wayne
多集群容器管理"] CloudDM["CloudDM
SQL 审核"] CacheCloud["CacheCloud
Redis 管理"] Apollo["Apollo
配置中心"] Grafana["Grafana
监控可视化"] QPass["qpass
告警通知"] end Portal -.->|SSO 跳转| Wayne & CloudDM & CacheCloud & Apollo & Grafana & QPass Wayne -->|Client-Go| RKE2["RKE2 集群"] CloudDM -->|SQL 审核| MySQL[("MySQL")] CacheCloud -->|Agent| Redis[("Redis")] Apollo -->|ConfigService| RKE2 ```
> 子系统各自独立部署和授权,主系统只做 SSO 跳转入口,各子系统自行维护操作审计。
--- # 平台分层架构 — 基础设施层
```mermaid graph TB subgraph 计算 RKE2["RKE2 集群 × 7 机房
CIS 安全加固"] end subgraph 网络 Calico["Calico BGP
每集群独立 AS 号
跨机房扁平互通"] end subgraph 存储 Ceph["Ceph RBD
MySQL/Redis 有状态服务 PV"] end subgraph 自动化 Ansible["Ansible Playbook
节点初始化 · 服务部署
WebSocket 实时日志"] end RKE2 --> Calico RKE2 --> Ceph Ansible -->|SSH| RKE2 ```
> RKE2 是计算底座,Calico BGP 构建跨机房扁平网络,Ceph RBD 提供持久化存储,Ansible 贯穿自动化运维。
--- # 部署架构
```mermaid graph TB subgraph "RKE2 集群(任一机房)" subgraph "xinfra 命名空间" FE["Nginx
前端静态文件 + 反向代理"] BE["Go API Server
Deployment × 2"] WS["WebSocket Gateway
任务日志实时推送"] end subgraph "监控命名空间" VM[("VictoriaMetrics")] Grafana["Grafana"] NE["Nightingale"] end subgraph "子系统命名空间" Wayne["Wayne"] CloudDM["CloudDM"] CacheCloud["CacheCloud"] Apollo["Apollo"] end end LB["SLB / NodePort"] --> FE FE -->|/api/*| BE FE -->|WebSocket| WS BE --> MySQL[("MySQL 8.0 主从")] BE --> Redis[("Redis 会话缓存")] BE -->|SSH/Ansible| Nodes["业务节点池"] WS --> BE style FE fill:#e0f2fe,stroke:#0284c7 style BE fill:#e0f2fe,stroke:#0284c7 style WS fill:#e0f2fe,stroke:#0284c7 ```
--- # 监控告警数据流
```mermaid graph LR subgraph 采集源 RKE2["RKE2 集群"] Zabbix["Zabbix
硬件监控"] end subgraph 指标存储 VM[("VictoriaMetrics
容器/业务指标")] end subgraph 可视化 Grafana["Grafana 仪表盘"] end subgraph 告警链路 Nightingale["夜莺
去重 · 收敛 · 分级"] QPass["qpass
企业 IM 推送"] end RKE2 -.->|Metrics| VM VM --> Grafana VM --> Nightingale Zabbix -.->|Webhook| Nightingale Nightingale --> QPass Zabbix -->|Zabbix API| Main["XINFRA 主系统
资源状态看板"] ```
> Zabbix 硬件监控分两条链路:告警事件通过 Webhook 推送至夜莺统一聚合;可观测数据(IPMI/温度/电源/风扇等)由主系统直接调用 Zabbix API 采集展示。
--- # 基础服务交付流程
```mermaid sequenceDiagram actor User as 业务人员 participant Portal as XINFRA 服务目录 participant Ansible as Ansible Playbook participant Infra as RKE2 / 主机 participant Sub as 子系统注册 User->>Portal: 选择服务卡片,填写业务线、规格 Portal->>Portal: 实时预览 playbook 参数(YAML) User->>Portal: 确认部署 Portal->>Ansible: 提交 playbook 任务 Ansible->>Infra: 内核初始化 · containerd · 加入集群 Ansible-->>Portal: 任务状态 → WebSocket 实时日志 Portal->>Sub: 自动注册(CloudDM / CacheCloud) Portal-->>User: 部署完成,跳转任务中心 ```
> 用户通过服务卡片填参 → Ansible 自动化部署 → 完成后自动注册到对应子系统,全程日志实时查看。
--- # 多租户隔离模型(Phase 2+)
```mermaid graph TB LDAP["企业 LDAP"] -->|部门 DN| BL["业务线租户
Kodo / LAS / 灵矽 / ..."] BL --> NS["Kubernetes Namespace
+ ResourceQuota + LimitRange"] BL --> NP["物理节点池
node-label + taint"] NS -.->|Pod 只能调度到
本业务线节点| NP style LDAP fill:#f3e8fd,stroke:#9333ea style BL fill:#e0f2fe,stroke:#0284c7 style NS fill:#ecfdf5,stroke:#059669 style NP fill:#fef3c7,stroke:#d97706 ```
> **双重隔离**:节点层通过 `business-line=xxx` 标签 + Taint 确保 Pod 调度隔离;命名空间层通过 ResourceQuota / LimitRange 限制资源用量上限。 > Phase 1 仅做基础设施准备(节点标签预留),多租户功能为 Phase 2+。
--- # 安全认证流程
```mermaid sequenceDiagram actor User as 用户 participant Main as XINFRA 主系统 participant LDAP as 企业 LDAP participant Sub as 子系统 User->>Main: 访问主系统 Main->>LDAP: SAML 认证请求 LDAP-->>Main: SAML Response(用户身份 + LDAP 组信息) Main->>Main: 签发 JWT Token(含角色 + 业务线) Main-->>User: 登录成功,返回 Token User->>Main: 点击子系统卡片 Main->>Sub: OAuth 2.0 Authorization Code Sub->>Main: 验证 Token,创建子系统会话 Main-->>User: 跳转至子系统(免登录) ```
> 外部 LDAP 通过 SAML 集成统一认证;子系统 SSO 通过 OAuth 2.0 对接,实现单点登录免跳转。
--- section: 架构描述 layout: center --- # 三、架构描述
技术选型 · 数据库设计 · 安全机制 · 运维模型
--- layout: default --- # 技术选型
| 层级 | 选型 | |------|------| | 前端框架 | Vue 3 + Element Plus | | 后端框架 | Go + Gin | | 前后端通信 | REST/JSON,URL 路径版本 | | 主系统数据库 | MySQL 8.0 | | 缓存 | Redis | | 前端部署 | Nginx | | 主系统部署 | K8s Deployment |
| 层级 | 选型 | |------|------| | SSO 协议 | OAuth 2.0 + SAML | | 告警数据源 | Nightingale + Zabbix API | | Ansible 调度 | SSH 直接执行 | | 实时推送 | 原生 WebSocket | | 接口文档 | Swagger/OpenAPI | | 界面语言 | 纯中文 | | 测试策略 | 后端单元 + 集成测试 |
### 选型依据 | 选型 | 理由 | 备选淘汰原因 | |------|------|------------| | Vue 3 + Element Plus | 七牛内部技术栈统一,团队有 Vue 2 迁移经验 | React + Ant Design — 学习成本更高 | | Go + Gin | Wayne/CloudDM 同生态,可复用 Client-Go、GORM | Java Spring Boot — 部署资源占用更大 | | MySQL 8.0 | 运维团队已有经验和工具链,CloudDM 原生支持 | PostgreSQL — 团队运维经验不足 | --- # API 设计规范
| 规范项 | 约定 | |--------|------| | 路由命名 | RESTful 风格,资源名复数 | | 版本管理 | URL 路径版本 `/api/v1/...` | | 分页 | `?page=1&pageSize=20`,响应含 `total` | | 排序 | `?sort=created_at&order=desc` | | 筛选 | `?status=running&businessLine=kodo` |
| 规范项 | 约定 | |--------|------| | 错误码 | HTTP 状态码 + 业务错误码 | | 认证 | Bearer Token(JWT),OAuth 2.0 获取 | | 响应格式 | `{ "code": 0, "data": {...} }` | | 接口文档 | Swagger/OpenAPI 3.0 |
### 路由示例 ``` GET /api/v1/clusters # 集群列表 GET /api/v1/clusters/:id/nodes # 集群节点 POST /api/v1/tasks # 创建任务 GET /api/v1/audit-logs?page=1&pageSize=20 ``` --- # 数据库 ER 设计(核心表)
```mermaid erDiagram USERS ||--o{ AUDIT_LOGS : "产生" USERS ||--o{ TASKS : "执行" USERS ||--o{ API_KEYS : "拥有" USERS { bigint id PK varchar username UK "LDAP 用户名" varchar role "管理员/操作员/访客" varchar business_line "所属业务线" } AUDIT_LOGS { bigint id PK bigint user_id FK varchar action "login/terminal/playbook" varchar ip "来源 IP" } TASKS { bigint id PK varchar task_type "ansible/wayne-deploy" varchar status "pending/running/success/failed" bigint user_id FK } API_KEYS { bigint id PK varchar key_hash UK "密钥哈希" varchar scope "授权范围" datetime expires_at } CLUSTERS { bigint id PK varchar name UK "集群名称" varchar datacenter "所在机房" varchar status "健康状态" } NODES { bigint id PK bigint cluster_id FK varchar hostname "主机名" varchar business_line "业务线标签" } RESOURCES { bigint id PK varchar hostname UK "主机名" varchar source "cmdb/alicloud/aws/las" varchar lifecycle "production/idle/retired" } ```
--- # 安全机制
### 认证与授权 | 层面 | 机制 | |------|------| | 身份认证 | SAML + OAuth 2.0 | | 访问控制 | RBAC + 业务线维度 | | 传输安全 | HTTPS + TLS 1.2+ | | 数据加密 | AES-256,敏感字段加密存储 | | APIKey 管理 | SHA-256 哈希存储,scope 粒度授权 |
### 审计与隔离 | 层面 | 机制 | |------|------| | 审计留痕 | 登录/运维/API 全程记录,不可篡改 | | 网络隔离 | BGP + 防火墙,管理面与数据面分离 | | 凭证管理 | 禁止默认凭证,Vault / K8s Secret | | Ansible/SSH | 仅管理员可见,普通用户菜单不包含 |
> **RBAC 二维模型**:权限维度(角色能力)× 业务线维度(资源范围),遵循最小权限原则。 > 所有跨层操作全程审计留痕。
--- # 运维分层模型
| 故障层级 | 处理方 | 工具链 | 权限要求 | |---------|--------|--------|---------| | 应用发布异常 | 子系统自愈 | Wayne 一键回滚 | 项目成员 | | 中间件故障 | 子系统自恢复 | CacheCloud / CloudDM 内置能力 | 子系统运维角色 | | 配置变更异常 | Apollo 回滚 | Apollo 版本回滚 + 灰度发布 | 配置管理员 | | 基础设施故障 | 主系统管理员 | Ansible Playbook / SSH 终端 | 仅主系统管理员 | | 机房级故障 | 主系统管理员 | Ansible + 大内网链路切换 | 仅主系统管理员 |
> 故障按层级自愈,跨层操作需主系统管理员权限。Ansible / SSH 终端等基础设施级操作仅对管理员角色可见,所有跨层操作全程审计留痕。
--- # 风险与约束
| 风险 | 缓解措施 | |------|---------| | RKE2 版本升级不兼容 | 测试环境验证,灰度发布 | | Wayne 开源维护不确定 | 内部 Fork,保持核心可维护 | | 七机房网络链路故障 | 网络冗余 + BGP 自动切换 | | SQL 审核规则误判 | 白名单机制 + 规则持续调优 | | Redis 大 Key / 热 Key | CacheCloud 诊断 + 应用侧治理 |
| 风险 | 缓解措施 | |------|---------| | Apollo 多机房配置一致性 | 本地缓存降级 + 灰度发布 | | Consul 跨机房同步延迟 | 30 秒轮询 + 健康状态标注 | | 云平台 API 限流 | 增量同步 + 重试 + 状态告警 | | AWX 未引入,Ansible 直调 | 自建任务队列 + WebSocket 日志 | | Go/Gin 开发人力 | 复用 Wayne/CloudDM 生态降低学习成本 |
--- layout: center --- # 总结
### 🏗 四层架构 用户层 → 主系统层
→ 子系统层 → 基础设施层
### 🔐 统一安全 LDAP SAML 认证
RBAC + 业务线隔离
全程审计留痕
### 🚀 自动化运维 Ansible IaC 交付
WebSocket 实时日志
故障分层自愈
XINFRA — 统一基础设施管理平台