Principal Site Reliability Engineer
Core
Design, implement, and improve highly reliable, scalable, and resilient platform solutions across the enterprise while driving operational excellence and automation.
Role type
Principal Site Reliability Engineer (SME)
Builds
Enterprise platform solutions, self-healing systems, and operational workflows
Domain
Financial services / Cloud infrastructure
Deliverable
production ML models | product features | infrastructure
Required skills
System design, reliability engineering, production operations, programming/scripting languages, incident management, root cause analysis, observability strategies, automation, capacity planning, SLO/SLA definition
Preferred skills
Observability tooling, cloud platforms (AWS/Azure), CI/CD/DevOps, regulated environment experience
Technologies
AWS, Azure, CI/CD, DevOps, SLO/SLI frameworks
Responsibilities
Define service reliability standards (SLOs, SLAs, error budgets), design fault-tolerant architectures, lead incident management and post-incident reviews, drive problem management and root cause analysis, develop observability strategies, lead automation initiatives, mentor engineers, partner with development and security teams, ensure regulatory compliance
Seniority
Principal, hands-on IC with strategic influence