Site Reliability Engineering
Core
Ensure reliability, scalability, and performance of cloud-based SaaS services and AWS infrastructure through incident management, monitoring, and automation.
Role type
Junior Site Reliability Engineer (0-2 years)
Builds
Cloud-based SaaS services and AWS infrastructure
Domain
Cybersecurity / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
AWS cloud services, Python/PowerShell/Shell scripting, Infrastructure as Code (Terraform/Ansible), containerization (Docker), Kubernetes, CI/CD pipelines, monitoring and alerting tools, incident response, cost optimization, security best practices
Preferred skills
AWS Certification, AWX Tower, Security Certification, AI-assisted development tools
Technologies
AWS, Datadog, Site24x7, Terraform, Ansible, Docker, Kubernetes, Jenkins, GitHub, CloudWatch, Grafana, AWX Tower
Responsibilities
Drive incident response and troubleshoot outages, establish monitoring and alerting best practices, build automation tooling for issue remediation, participate in 24x7 on-call rotation, optimize cloud costs and system performance, implement security best practices, automate provisioning and deployment using IaC
Seniority
Junior, hands-on IC