xi
xinfra 统一基础设施平台
● 生产环境
王
王晓东
LDAP · Kodo业务线

资源大盘

跨机房 / 多云容器资源统一视图 · 最近更新于 12 秒前

RKE2 集群
3
3 机房在线
节点总数
128
↑ 6 本周新增
CPU 已分配
61%
2,048 / 3,360 核
组件实例
214
MySQL 38 · Redis 92 · 其他 84
进行中任务
2
1 个待关注

集群拓扑 · 按机房 / 业务线标签

node-label 调度视图
IDC-华北机房46节点
IDC-华东机房52节点
阿里云-华南30节点
Kodo业务线 LAS业务线 灵矽业务线 空闲

最近任务

查看全部 →
● 成功MySQL 主从部署2m14s
● 执行中RKE2 节点加入38s
● 成功Redis Cluster 部署3m02s
● 失败openresty 网关部署41s
● 成功业务线标签同步5s

资源状态看板

物理机 / 虚机 / 基础服务状态汇总 · 夜莺(Nightingale)统一告警引擎对接 Zabbix + VictoriaMetrics · 最近更新于 18 秒前

物理机总数
186
186 / 186 监控覆盖
虚机总数(LAS)
512
↑ 14 本周新增
基础组件实例
214
MySQL 38 · Redis 92 · 其他 84
P0 / Disaster 告警
1
来自 VictoriaMetrics
P1 / High 告警
5
来自 Zabbix · 4 条 / VM · 1 条

告警来源接入 · 夜莺统一告警

Nightingale ← Zabbix / VictoriaMetrics
Zabbix 物理机 / 硬件层
IPMI · 温度 · 电源 · 风扇
网络设备 · 存储健康度
事件级别:disaster / high / average
VictoriaMetrics 虚机 / 容器 / 业务层
K8s / 容器 / 主机指标
基础服务可用性探活
告警级别:P0 / P1 / P2
夜莺 Nightingale 统一告警引擎
按 P0/P1 或 disaster/high/average 过滤聚合
去重 · 收敛 · 分级推送
下游:qpass 统一告警通道

物理机状态 · 按机房

数据源:Zabbix
机房总数在线健康率状态
YZH 机房787898%● 正常
XS 机房646391%● 1 条告警
JF 机房2222100%● 正常
海外 IDC(4)222186%● 1 条严重

虚机状态 · LAS 资源池

数据源:VictoriaMetrics
业务线虚机数CPU 均值状态
Kodo21864%● 正常
LAS16482%● 1 条告警
灵矽9657%● 正常
共享池 / 未分配3431%● 正常

基础服务状态汇总

MySQL / Redis / 中间件 · 探活数据源:VictoriaMetrics
服务类型实例数异常可用率状态
MySQL380100%● 正常
Redis(CacheCloud)92198.9%● 1 条告警
PostgreSQL120100%● 正常
openresty 网关260100%● 正常
其他中间件460100%● 正常

当前告警 · P0/P1(disaster / high / average)

夜莺聚合 · 已去重
级别来源原始级别对象告警内容时间
P0VictoriaMetricsdisastersg-las-overseas-007磁盘只读 / IO 错误,节点不可写07:38:55
P1Zabbixhighyzh-las-014风扇转速低于阈值(FAN_6: 1920 RPM)07:35:12
P1Zabbixhighxs-bm-291电源冗余丢失(PSU2 离线)07:21:40
P1VictoriaMetricshighredis-ads-feature-cluster-02慢查询比例超阈值(>5%,持续5分钟)07:18:03
averageZabbixaverageoverseas-dallas-idc专线延迟抖动超基线(WireGuard ↔ AWS US)07:10:22
averageZabbixaveragejf-bm-118CPU 温度接近阈值(76℃ / 80℃)06:58:47

集群 / 节点

按机房切分的 RKE2 集群,Calico BGP 扁平网络

集群机房 / 区域状态节点CPU 使用RKE2 版本Calico
rke2-bj-prod-01华北 · IDC● 健康4664%v1.28.9+rke2r1BGP AS64512
rke2-sh-prod-01华东 · IDC● 健康5271%v1.28.9+rke2r1BGP AS64513
rke2-ali-sz-01阿里云 · 华南● 1 节点告警3083%v1.28.6+rke2r1BGP AS64514

rke2-bj-prod-01 · 节点列表(节选)

node-label 多租户隔离
节点IP业务线标签污点 Taint规格CPU / Mem状态
bj-node-01410.21.4.14business-line=kodokodo:NoSchedule64C/256G58%● Ready
bj-node-01510.21.4.15business-line=kodokodo:NoSchedule64C/256G62%● Ready
bj-node-03110.21.4.31business-line=laslas:NoSchedule32C/128G88%● 资源告警
bj-node-04810.21.4.48未分配—32C/128G4%● Ready · 空闲

业务线 / 配额

LDAP 部门信息自动同步生成,节点标签 + ResourceQuota 双重隔离

业务线LDAP 部门归属节点数CPU 配额已用命名空间负责人
kodo · Kodo业务线ou=kodo,dc=company,dc=com421,344 核58%ns-kodo-prod王晓东
las · LAS业务线ou=las,dc=company,dc=com381,216 核85%ns-las-prod李雯
lingxi · 灵矽业务线ou=lingxi,dc=company,dc=com26832 核47%ns-lingxi-prod张昊
ltoken · LTOKEN业务线ou=ltoken,dc=company,dc=com14448 核33%ns-ltoken-prod陈思
maas · MAAS业务线ou=maas,dc=company,dc=com8256 核21%ns-maas-prod赵帆
隔离策略说明:节点标签(nodeAffinity + taints)决定 Pod 只能调度到归属业务线的物理节点上;ResourceQuota / LimitRange 在此基础上限制命名空间内的资源上限,二者结合避免单一业务线在自己的节点池内无限占用资源。

基础服务目录

点击卡片,通过封装好的 ansible-playbook 一键部署标准化基础服务

My

MySQL

一主多从,自动注册进 open-cdm 数据源,支持 LDAP 账号统一审核 SQL 上线。
roles/mysql-deployv8.0.36
Rd

Redis

支持 Standalone / Sentinel / Cluster,部署完成后自动注册进 CacheCloud。
roles/redis-deployv7.2
Or

openresty

容器化部署在 K8s 内,作为业务边缘网关,支持灰度路由配置。
roles/openresty-deployv1.25
Dp

dpvs

四层负载均衡,直接管理宿主机网络命名空间,不纳入容器编排。
roles/dpvs-deployv1.9
Pg

PgSQL

流复制主从架构,规划中 · 第二期接入 open-cdm 统一审核体系。
roles/pgsql-deploy规划中
+

接入新服务

封装新的 ansible-playbook,注册进基础服务目录

组件实例

所有基础组件实例的统一台账,关联 CMDB / 子系统注册状态

实例类型业务线所在集群状态子系统注册
mysql-kodo-order-01MySQL 8.0 主从kodorke2-bj-prod-01● 运行中open-cdm ✓
redis-las-feature-clusterRedis Clusterlasrke2-sh-prod-01● 运行中CacheCloud ✓
redis-lingxi-sessionRedis Sentinellingxirke2-ali-sz-01● 同步中CacheCloud 同步中…
mysql-las-billing-01MySQL 8.0 主从lasrke2-sh-prod-01● 运行中open-cdm ✓
mysql-ltoken-account-01MySQL 8.0 主从ltokenrke2-bj-prod-01● 运行中open-cdm ✓
redis-maas-infer-cache-01Redis Standalonemaasrke2-ali-sz-01● 运行中CacheCloud ✓

资源管理

统一纳管物理机与虚机资源 · 基础数据来自 SINA CMDB,云上虚机由阿里云 / AWS / 七牛 LAS 增量同步回写

资源总数
658
物理机 146 · 虚机 512
SINA CMDB
368
物理机 146 · 虚机 222
阿里云同步
154
ECS · 增量同步
AWS / 七牛 LAS 同步
136
AWS 58 · 七牛 LAS 78
最近一次同步
● 正常
07:39:10 · 新增 3 条

资源台账 · 物理机 / 虚机

SINA CMDB asset items + 云厂商同步增量
主机名资产编号类型机房 / 区域内网 IP规格业务线数据来源状态
xs291SERV00003502物理机华东·杭州下沙10.34.37.5220C/192G/13.52TkodoSINA CMDB● production
yzh-las-014SERV00004187虚机华北·YZH10.21.4.21432C/128G/4.0TlasSINA CMDB● production
jf-bm-118SERV00004290物理机华南·JF10.45.2.1816C/64G/2.0TlingxiSINA CMDB● production
ali-ecs-sz-0231—虚机阿里云·华南172.18.4.3116C/64G/500Gltoken阿里云同步● production
aws-us-i-0a13fe2—虚机AWS · 美国10.66.2.128C/32G/200GmaasAWS 同步● production
sg-las-007SERV00004511虚机七牛 LAS · 新加坡10.88.1.0716C/64G/2.0Tlas七牛 LAS 同步● idle
hk-bm-001SERV00004602物理机香港 IDC10.90.0.118C/32G/1.0T未分配SINA CMDB● production
同步与去重策略:SINA CMDB 作为物理机 / 虚机的基础数据底座;阿里云、AWS、七牛 LAS 的虚机资源由各云 OpenAPI 定时增量同步回写。同步时先以唯一标识(资产编号 / 实例 ID / 内网 IP)查询数据库中是否已存在记录:已存在则跳过更新,保留 CMDB 侧人工维护的字段;不存在则新增记录并标记对应数据来源(SINA CMDB / 阿里云同步 / AWS 同步 / 七牛 LAS 同步),避免重复纳管与覆盖人工修正数据。

服务管理

同步全部机房 Consul 注册中心服务目录,统一查看服务名 / 服务 IP / 业务标签 / 实例数

接入 Consul Datacenter
7
国内 3 · 海外 4
服务总数
186
去重后唯一服务名
服务实例总数
842
所有机房注册 IP 汇总
健康实例占比
98.6%
12 个实例 critical
最近同步
● 正常
07:41:05 · 间隔 30s

服务台账 · 按 Consul Datacenter 同步

数据源:Consul Catalog API(/v1/catalog/services · /v1/health/service)
服务名机房 / Datacenter业务标签实例数健康实例示例 IP状态
kodo-gateway-svcYZHkodo1212 / 1210.21.4.51● 健康
kodo-upload-svcXSkodo1010 / 1010.34.37.66● 健康
las-search-apiXSlas1817 / 1810.34.37.20● 部分异常
las-order-svc达拉斯 IDClas55 / 510.66.2.20● 健康
lingxi-render-svcJFlingxi66 / 610.45.2.30● 健康
ltoken-wallet-svcYZHltoken88 / 810.21.4.88● 健康
maas-infer-svc新加坡 IDCmaas43 / 410.88.1.40● 部分异常
同步方式:xinfra 定时调用各机房 Consul 集群的 Catalog API(/v1/catalog/services、/v1/health/service)按 Datacenter 维度拉取服务目录,汇总服务名、注册 IP、健康检查状态以及 Consul service tag 中携带的业务标签(kodo / las / lingxi / ltoken / maas),实现跨机房服务的统一查看与健康巡检,不改变各机房 Consul 自身的注册与发现链路。

监控 / 日志 / 告警

VictoriaMetrics 指标 · Zabbix 硬件状态 · ELK 日志中心 · 夜莺(Nightingale)统一告警引擎对接 qpass

VictoriaMetrics · 指标概览

K8s / 容器 / 业务指标
七机房采集节点数128
活跃时序数量42.6M
Prometheus 接口接入● 正常
Grafana 仪表盘数37

Zabbix · 硬件健康

IPMI / 温度 / 电源 / 风扇
物理机监控覆盖186 / 186
当前告警● 2 条(风扇转速异常)
网络设备健康● 正常
存储健康度● 正常

日志 + 统一告警

Filebeat → Kafka → ES → Kibana · VM + Zabbix → qpass
07:39:10CMDB 采集器同步完成:xs291 · 华东-杭州下沙机房
07:38:55[Zabbix] 告警:yzh-las-014 风扇转速低于阈值(FAN_6: 1920 RPM)
07:38:02[VictoriaMetrics] 七机房抓取任务全部正常
07:35:41[ELK] sg-las-007 应用日志接入 Kafka topic:las-sg-app
07:30:00[qpass] 告警已合并推送:1 条硬件告警 + 0 条业务告警

任务中心

所有 ansible-playbook / Wayne 发布任务的执行记录与实时日志

任务列表

● 执行中RKE2 节点加入 · bj-node-061roles/rke2-node-join
● 成功MySQL 主从部署 · kodoroles/mysql-deploy
● 成功Redis Cluster 部署 · lasroles/redis-deploy
● 失败openresty 网关部署roles/openresty-deploy
● 成功业务线标签同步 · LDAPinternal/label-sync
● 成功MySQL 主从部署 · ltokenroles/mysql-deploy

实时日志 · RKE2 节点加入

WebSocket 流式输出
10:42:01PLAY [rke2-node-join] **********************
10:42:02TASK [初始化内核参数] ...
10:42:04ok: [bj-node-061]
10:42:05TASK [安装 containerd] ...
10:42:18ok: [bj-node-061]
10:42:19TASK [写入 RKE2 node-labels: business-line=kodo] ...
10:42:20changed: [bj-node-061] => labels applied
10:42:21TASK [加入集群 rke2-bj-prod-01] ...
10:42:33▌ 等待节点 Ready...

配置中心管理

Apollo 配置中心(携程开源)· 按机房部署 Config Service Cluster,Portal 统一入口管理

● 运行中
接入机房数
3 / 7
国内 3 已接入 · 海外 4 建设中
Apollo Cluster
7
按机房 1:1 划分
配置项总数
1,260
Namespace 38 个
接入业务线
2 / 5
kodo · las 已接入
同步状态
● 正常
最近发布 09:12:30

统一入口

Apollo Portal · LDAP 单点登录

Apollo Portal

apollo.xinfra.internal

统一管理 7 个机房 Config Service Cluster 的配置发布、灰度、回滚与变更审计,所有机房配置项均可在此单一入口检索与编辑,发布后由各机房 Config Service 就近下发。

LDAP 原生配置接入 · 已上线
打开 Apollo Portal ↗

部署架构说明

Config Service / Admin Service / Portal
Portal + Admin Service YZH 主中心统一部署
配置发布、权限、审计统一入口
LDAP 账号统一登录
跨机房管理所有 Cluster
Config Service 每机房独立集群
Cluster = 机房标识(yzh / xs / jf ...)
客户端就近读取,降低跨机房延迟
单机房故障不影响其他机房取配置
配置数据同步 MySQL 主从 + 缓存
ConfigDB / PortalDB 部署在 YZH
各机房 Config Service 本地缓存全量配置
网络抖动时仍可降级提供本地缓存配置

机房配置中心列表

Cluster 维度 · Config Service 部署明细
机房 / 区域Apollo ClusterConfig Service 地址承载方式接入业务线配置项数状态
YZH 机房cluster=yzhconfig-yzh.xinfra.internal:8080容器化 · K8s Servicekodo486● 运行中
XS 机房cluster=xsconfig-xs.xinfra.internal:8080容器化 · K8s Servicelas398● 运行中
JF 机房cluster=jfconfig-jf.xinfra.internal:8080容器化 · K8s Service灵矽376● 灰度接入中
达拉斯 IDCcluster=dallas—容器化 · K8s Service—0● 建设中
新加坡 IDCcluster=singapore—容器化 · K8s Service—0● 建设中
香港 IDCcluster=hk—容器化 · K8s Service—0● 待启动
东南亚 IDCcluster=sea—容器化 · K8s Service—0● 待启动
使用说明:YZH / XS 两机房已正式运行,kodo / las 业务线配置已接入;JF 机房处于灰度接入阶段。所有机房的配置统一通过 Apollo Portal 单一入口检索、编辑与发布,发布后由对应机房 Config Service 就近下发给客户端,机房间故障隔离、互不影响。达拉斯、新加坡、香港、东南亚四个海外机房按第三期规划陆续建设 Config Service 集群,建成后接入对应业务线配置。

子系统导航

统一 LDAP 账号,点击即用免二次登录(同账号同密码)

Wayne

多集群发布平台

业务容器发布、命名空间与配额管理,复用 Wayne 原生多租户能力。

LDAP 原生配置接入 · 零代码

open-cdm

SQL 审核与变更平台

数据库 SQL 上线统一审核,支持 LDAP 用户组到角色的自动映射。

LDAP 原生配置接入 · 零代码

CacheCloud

Redis 统一管理平台

Redis 实例全生命周期管理,登录与监控运维统一入口。

LDAP 接入改造中 · 预计 3 天

qpass

统一告警 / 值班平台

夜莺、Zabbix、VictoriaMetrics 告警统一收敛与值班通知,按 P0/P1 分级推送。

LDAP 原生配置接入 · 零代码

Grafana

指标可视化平台

对接 VictoriaMetrics 数据源,K8s / 容器 / 业务指标统一仪表盘展示。

LDAP 原生配置接入 · 零代码

Apollo

配置中心(携程开源)

统一配置管理,按机房 Cluster 隔离,支持灰度发布、版本回滚与变更审计。

LDAP 接入改造中 · 规划中