Associate Architect - Site Reliability
Core
Design and manage resilient cloud infrastructure, ensuring operational resilience, security, and scalability for production systems.
Role type
Associate Site Reliability Architect (IC)
Builds
Cloud infrastructure solutions, automation workflows, and monitoring systems
Domain
Cloud Engineering / Site Reliability Engineering
Deliverable
production ML models | infrastructure
Required skills
Cloud platform expertise (AWS/Azure/GCP), Containerization (Docker), Orchestration (Kubernetes), Scripting (Shell/Python), IaC (Terraform/CloudFormation), Monitoring (Prometheus/Grafana/ELK/OpenTelemetry), Linux internals, Virtualization (VMware/Hyper-V/KVM), Networking protocols
Preferred skills
DevOps toolchain (Git/Jenkins/ArgoCD), Database management (MySQL/Hadoop), Cloud cost optimization, Gen AI exposure, Disaster recovery planning, ITIL processes
Technologies
AWS, Azure, GCP, Docker, Kubernetes, Python, Shell, Ansible, Puppet, Terraform, CloudFormation, Prometheus, Grafana, ELK, OpenTelemetry, Rundeck, Jenkins, VMware, Hyper-V, KVM, RHEL, CentOS, Rocky Linux, MySQL, Hadoop
Responsibilities
Design and maintain resilient cloud infrastructure; Establish monitoring and alerting systems using SLI/SLO/SLA concepts; Automate infrastructure provisioning and standardization; Resolve major incidents and conduct root cause analyses; Collaborate with cross-functional teams on POCs and tool adoption
Seniority
Mid-Senior, hands-on IC