Site Reliability Engineer (SRE)
Core
Ensure reliability, availability, and scalability of AI-powered Personal & Entrepreneurial Resource Planner systems.
Role type
Site Reliability Engineer (SRE)
Builds
Cloud-native infrastructure, observability tools, CI/CD pipelines, and disaster recovery strategies for a global SaaS platform.
Domain
SaaS / AI-driven resource planning / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
Cloud platform expertise (AWS/Azure/GCP), Infrastructure as Code (Terraform/CloudFormation), Container orchestration (Kubernetes/Docker), Linux system administration, Observability tooling (Prometheus/Grafana/ELK/Datadog), Scripting (Python/Go/Bash), Incident management and root cause analysis, Distributed systems knowledge.
Preferred skills
Load balancing and failover strategy design, Cloud cost optimization, Security best practices implementation.
Technologies
AWS, Azure, GCP, Terraform, CloudFormation, Pulumi, Docker, Kubernetes, Helm, Prometheus, Grafana, ELK, Datadog, New Relic, Bash, Python, Go.
Responsibilities
Design and implement scalable, fault-tolerant systems across cloud environments; Develop and maintain observability tools including monitoring, logging, and alerting; Automate infrastructure provisioning, deployment, and incident response using IaC tools; Optimize system performance, scalability, and incident response workflows; Conduct root cause analysis and implement preventative measures; Ensure high availability by designing and maintaining load balancing, failover, and disaster recovery strategies; Improve CI/CD pipelines to enhance deployment speed while maintaining stability; Optimize cloud cost and resource utilization; Participate in on-call rotations to address system failures.
Seniority
Mid-Senior, hands-on IC