Site Reliability Engineer Lead (SRE) – Internal Kubernetes Container Platform (IKCP)
Core
Lead the reliability, scalability, performance, security, and operational excellence of the enterprise Internal Kubernetes Container Platform (IKCP) serving application teams.
Role type
Senior IC Site Reliability Engineer Lead (Kubernetes/OpenShift)
Builds
Highly available platform-as-a-product experience for application teams
Domain
Financial Services / Cloud-Native Container Platforms
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Kubernetes, OpenShift, Rancher, VKS, Linux administration, Terraform, Ansible, GitOps, ArgoCD, Helm, CI/CD, Monitoring/observability tools, Networking, Storage, Disaster recovery, Python/Go/Bash scripting
Preferred skills
BS/MS in CS/Engineering, OpenShift/Kubernetes certifications, VMware/VCF/OpenShift Virtualization, Cloud-native security controls, Platform engineering models, Vulnerability management
Technologies
OpenShift, Kubernetes, Rancher, VKS, Dynatrace, Prometheus, Grafana, Splunk, ELK, OpenTelemetry, Jenkins, GitHub, GitLab, Bitbucket, Terraform, Ansible, ArgoCD, Helm
Responsibilities
Own platform reliability objectives including service availability and resiliency; Lead critical incident response, root cause analysis, and problem management; Execute platform upgrades, patching strategies, and cluster modernization; Design and implement enterprise observability solutions; Automate operational processes using IaC and GitOps; Perform platform capacity planning and trend analysis; Partner with security teams to implement platform security controls and governance.
Seniority
Senior, hands-on IC with leadership responsibilities