Loading...
Loading...
Diagnoses, predicts, and mitigates node disruptions during Compute Engine host maintenance and hardware or software maintenance events for GPU and TPU workloads on GKE. Use when diagnosing node disruptions, predicting host maintenance events on GPU/TPU nodepools, inspecting node interruption PromQL metrics, auditing node taints, or configuring workload protection strategies (graceful termination, opportunistic maintenance, PodDisruptionBudgets). Don't use for general GKE cluster creation, network policy configuration, or non-disruption workload deployment.
npx skill4agent add google/skills gke-ai-troubleshooting-handle-disruption-gpu-tpuproject_idlocationcluster_nametimestampnode_nameworkload_nameworkload_namespacenodepool_namekubectlkubectl get nodes -l cloud.google.com/scheduled-maintenance-time -L cloud.google.com/scheduled-maintenance-timeSCHEDULED-MAINTENANCE-TIMEkubernetes_io:node_interruption_countinterruption_reason="HW/SW Maintenance"# Fetch host maintenance events for nodes
sum by (interruption_type,interruption_reason)( sum_over_time( kubernetes_io:node_interruption_count{monitored_resource="k8s_node", interruption_reason="HW/SW Maintenance"}[${__interval}]))# See the interruption count aggregated by node pool
sum by (node_pool_name,interruption_type,interruption_reason)( sum_over_time( kubernetes_io:node_pool_interruption_count{monitored_resource="k8s_node_pool", interruption_reason="HW/SW Maintenance", node_pool_name="{nodepool_name}" }[${__interval}]))kubernetes_io:node_interruption_countinterruption_reason="HW/SW Maintenance"query_logscloud.google.com/active-node-maintenanceONGOINGcloud.google.com/impending-node-termination:NoSchedulekubectl describe nodecloud.google.com/active-node-maintenanceONGOINGcloud.google.com/impending-node-termination:NoSchedulespec.terminationGracePeriodSecondsSIGTERMPodDisruptionBudgetminAvailable