Kubernetes · Operational reference
Toolkit
Operational artefacts for Kubernetes: checklists for cadences, runbooks for incidents, hands-on labs for skills, and break/fix scenarios for troubleshooting reflexes. None of this replaces reading the corresponding lessons — these are the artefacts you keep open in a second tab during real work.
- Runbooks
- 25
- Checklists
- 15
- Labs
- 25
- Break/Fix
- 30
- Assessments
- 1
Operational checklists
Repetitive tasks performed on a schedule.
Before deployment
- Backup and DR Readiness Checklist12 items→
- Control Plane Readiness Checklist14 items→
- Deployment Change Checklist12 items→
- Kubernetes Networking Readiness Checklist14 items→
- Cluster Observability Checklist13 items→
- Pre-Upgrade Checklist12 items→
- Kubernetes Cluster Production Readiness Checklist12 items→
- Kubernetes Security Checklist14 items→
- Kubernetes Storage Readiness Checklist13 items→
- Worker Node Readiness Checklist14 items→
- Workload Production Readiness Checklist14 items→
Runbooks
Step-by-step procedures. Treat the rollback as part of the procedure — never skip it.
Critical risk
- criticalcluster affectingRunbook: Build a New Kubernetes Cluster with kubeadm~90 min · 11 steps · verified 2026-08-16→
- criticalcluster affectingRunbook: Investigate an API Server Outage~45 min · 9 steps · verified 2026-08-16→
- criticalcluster affectingRunbook: Investigate etcd Health~30 min · 8 steps · verified 2026-08-16→
- criticalcluster affectingRunbook: Recover a Failed Control Plane~180 min · 10 steps · verified 2026-08-16→
- criticalcluster affectingRunbook: Restore etcd~120 min · 12 steps · verified 2026-08-18→
- criticalcluster affectingRunbook: Upgrade the Kubernetes Control Plane~120 min · 13 steps · verified 2026-08-16→
High risk
- highservice affectingRunbook: Deploy a Production Workload~60 min · 12 steps · verified 2026-08-16→
- highservice affectingRunbook: Drain a Production Node Safely~35 min · 10 steps · verified 2026-08-16→
- highcluster affectingRunbook: Renew Cluster Certificates~45 min · 8 steps · verified 2026-08-16→
- highservice affectingRunbook: Roll Back a Failed Deployment~25 min · 11 steps · verified 2026-08-16→
- highcluster affectingRunbook: Troubleshoot CNI~30 min · 10 steps · verified 2026-08-16→
- highdata loss riskRunbook: Troubleshoot CSI Mount Failure~30 min · 9 steps · verified 2026-08-16→
- highcluster affectingRunbook: Troubleshoot kubelet~30 min · 7 steps · verified 2026-08-16→
- highcluster affectingRunbook: Troubleshoot a NotReady Node~30 min · 10 steps · verified 2026-08-16→
- highservice affectingRunbook: Upgrade Worker Nodes~90 min · 10 steps · verified 2026-08-16→
Medium risk
- mediumcluster affectingRunbook: Back Up etcd~30 min · 10 steps · verified 2026-08-16→
- mediumservice affectingRunbook: Perform a Deployment Rollout~30 min · 10 steps · verified 2026-08-16→
- mediumservice affectingRunbook: Join a Worker Node to the Cluster~45 min · 10 steps · verified 2026-08-16→
- mediumcluster affectingRunbook: Troubleshoot CoreDNS~30 min · 11 steps · verified 2026-08-16→
- mediumservice affectingRunbook: Troubleshoot NetworkPolicy~25 min · 8 steps · verified 2026-08-16→
Low risk
- lowservice affectingRunbook: Investigate a CrashLoopBackOff Pod~25 min · 11 steps · verified 2026-08-16→
- lowservice affectingRunbook: Investigate an ImagePullBackOff Pod~20 min · 11 steps · verified 2026-08-16→
- lowservice affectingRunbook: Investigate an OOMKilled Pod~25 min · 10 steps · verified 2026-08-16→
- lowservice affectingRunbook: Investigate a Pending Pod~25 min · 11 steps · verified 2026-08-16→
- lowservice affectingRunbook: Troubleshoot Service Connectivity~25 min · 10 steps · verified 2026-08-16→
Hands-on labs
Time-boxed exercises.
B · Nested virtualisation
- Lab 1: Build a kubeadm cluster from bare hosts~150 min · 7 objectives→
- Lab 2: Inspect the control plane and etcd~120 min · 6 objectives→
- Lab 3: Deploy and inspect Pods~105 min · 6 objectives→
- Lab 4: Debug the Pod lifecycle~120 min · 5 objectives→
- Lab 5: Drive a Deployment rolling update~120 min · 5 objectives→
- Lab 6: Roll back a bad Deployment~120 min · 5 objectives→
- Lab 7: ConfigMaps and Secrets in a running workload~90 min · 5 objectives→
- Lab 8: Requests, limits, and QoS classes~120 min · 6 objectives→
- Lab 9: Diagnose an OOMKilled container~120 min · 6 objectives→
- Lab 10: Node affinity and scheduling constraints~90 min · 6 objectives→
- Lab 11: Cordon and drain a node safely~90 min · 5 objectives→
- Lab 12: Services and EndpointSlices~90 min · 5 objectives→
- Lab 13: Diagnose a Service that routes nowhere~90 min · 5 objectives→
- Lab 14: Inspect and troubleshoot CoreDNS~90 min · 5 objectives→
- Lab 15: Enforce and prove a NetworkPolicy~150 min · 5 objectives→
- Lab 16: Ingress and the Gateway API~120 min · 5 objectives→
- Lab 17: Dynamic provisioning with PVCs~120 min · 6 objectives→
- Lab 18: Diagnose a PVC stuck in Pending~120 min · 6 objectives→
- Lab 19: Operate a StatefulSet with persistent storage~120 min · 5 objectives→
- Lab 20: Build least-privilege RBAC~120 min · 6 objectives→
- Lab 21: Enforce Pod Security Standards~90 min · 6 objectives→
- Lab 22: Monitor the cluster with Prometheus~90 min · 5 objectives→
- Lab 23: Ship container logs off the node~120 min · 6 objectives→
- Lab 24: Take and verify an etcd snapshot~90 min · 6 objectives→
- Lab 25: Restore a cluster from an etcd snapshot~90 min · 6 objectives→
Break/Fix scenarios
Troubleshooting drills. Each scenario gives symptoms and evidence, then hides the solution behind a reveal.
kubernetes-api-server
kubernetes-cert
kubernetes-cni
kubernetes-coredns
kubernetes-csi
kubernetes-deployment
kubernetes-node-pressure
kubernetes-etcd
kubernetes-etcd-quorum
kubernetes-ingress
kubernetes-kubelet
kubernetes-networkpolicy
kubernetes-node
kubernetes-serviceaccount
kubernetes-pod-lifecycle
kubernetes-image
kubernetes-pod
kubernetes-pvc
kubernetes-taint
kubernetes-rbac
kubernetes-registry
kubernetes-cri-failure
kubernetes-endpoint
kubernetes-service
Assessments
Production-readiness examinations. Each combines auto-scored questions with scenario-based rubrics you can use to grade yourself.