面向企业级 Kubernetes 运行态势、诊断、容量治理的展示平台:私有集群只读产生脱敏快照,单向传输到公网侧完成时序回填、聚合与诊断,再以静态只读页面对外展示。不替代 Prometheus / Grafana,不充当生产控制面。
| Endpoint | Consec OK | Consec Fail |
|---|
3个HY2实例中断约7小时:IPv6地址此前用 ip -6 addr add 直接加到网卡,从未写进 netplan 配置,系统自动更新触发网卡重新拉起后地址被清空。修复:新建独立 netplan 文件持久化,不改会被 cloud-init 覆盖的默认配置文件。
K3s 网络排障三轮弯路后定位真根因:fail2ban 监听本机 nftables 的 DROP 日志前缀,K3s Pod 流量被自动误封,导致此前所有防火墙规则修改都不可能生效。修复分两层:fail2ban 白名单 Pod 网段 + 精确的 nftables 放行规则。
Endpoint Pool 从此前的 Lab 实验规模收缩为 5 个常驻高配 Pod,利用 K3s v1.36 的原地 CPU 弹性调整(InPlacePodVerticalScaling)在故障切换时提升 active 端点权重,无需删除重建 Pod。当前展示页的 Pool 数量就是这次收缩后的真实候选池,动态读取,不写死。