Principal Site Reliability Engineer
Core
Design availability and resiliency patterns in applications and infrastructure to improve performance, scalability, and latency while ensuring security standards.
Role type
Principal Site Reliability Engineer
Builds
Automation and tooling for application management, deployments, configuration changes, and disaster recovery scenarios.
Domain
Financial services / Cloud Infrastructure
Deliverable
production ML models | product features | infrastructure
Required skills
Python, Go, Java, Docker, Microservices Architecture, Kafka/SQS/JMS, Oracle/DynamoDB/Aurora, Redis/memcached, Linux administration, CI/CD pipelines (Git/Chef/Maven/Jenkins), Networking fundamentals
Preferred skills
Ruby, JavaScript, Kubernetes, Swarm, 24x7 production environment support
Technologies
Python, Go, Java, Docker, Kafka, SQS, JMS, Oracle, DynamoDB, Aurora, Redis, memcached, Git, Chef, Maven, Jenkins, AWS, Kubernetes, Swarm
Responsibilities
Design and implement software/tools for performance and availability; Build automation for deployments and disaster recovery; Design and evangelize observability systems; Evaluate application capacity and recommend scaling paths; Troubleshoot performance bottlenecks; Serve as technical liaison providing runbooks; Participate in 24x7 on-call rotation; Mentor team members and lead incident response.
Seniority
Principal, hands-on IC with mentorship