Principal Site Reliability Engineer (Kubernetes Required) - Hybrid
Core
Ensure reliability, scalability, and performance of production systems and services for financial data platforms.
Role type
Principal Site Reliability Engineer (Kubernetes)
Builds
Robust infrastructure, automated processes, and reliable services for investment professionals.
Domain
Financial technology / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
Kubernetes administration, incident response, SLO/SLI definition, automation design, capacity planning, system documentation
Preferred skills
Open-source contributions, Google SRE principles, DevOps/Platform Engineering experience
Technologies
Kubernetes, Helm, AWS/GCP/Azure, GitHub Actions/ArgoCD/Harness, Prometheus/Grafana/Coralogix/OpenTelemetry, Terraform/Pulumi, Ansible/Puppet/Chef, Python/Go/Bash
Responsibilities
Monitor and improve production system reliability and availability; Respond to and resolve incidents with post-mortems; Define and track SLOs and SLIs; Collaborate with development teams to build reliability into services; Design and implement automation to reduce toil; Participate in on-call rotation; Contribute to capacity planning and performance optimization; Document systems, processes, and runbooks
Seniority
Principal, hands-on IC with mentorship