Site Reliability Engineer (SRE) – II
Core
Maintain availability, scalability, and performance of critical infrastructure; build automation solutions for system reliability and continuous delivery.
Role type
Senior IC Site Reliability Engineer (Level II)
Builds
Automation scripts, IaC, monitoring/observability solutions, and resilient system architectures for internal services.
Domain
Financial Services / Cloud Infrastructure & SRE
Deliverable
infrastructure
Required skills
Linux/Unix administration, Python/Bash/Go scripting, Cloud platforms (AWS/GCP/Azure), Kubernetes/Docker, Terraform/Ansible, CI/CD, Networking fundamentals, Incident management, Monitoring/Observability
Preferred skills
MLOps, Data engineering, Cloud-native AI deployment, Security best practices for AI/cloud
Technologies
Terraform, Ansible, CloudFormation, Prometheus, Grafana, Datadog, Dynatrace, ELK Stack, Jenkins, GitLab CI, CircleCI, Kubernetes, Docker, AWS, GCP, Azure
Responsibilities
Lead troubleshooting for high-impact production issues and perform root cause analysis; Develop and maintain IaC and automation scripts; Analyze system performance and support capacity planning; Collaborate with engineering on scalable system design; Build and optimize monitoring/alerting dashboards; Implement security measures and compliance checks.
Seniority
Senior, hands-on IC with mentorship duties