Site Reliability Engineer - SRE
Core
Build and maintain reliable, observable, and secure cloud infrastructure to ensure optimal service availability for global customers.
Role type
Site Reliability Engineer (SRE)
Builds
Cloud infrastructure (bare metal, VMs, containers, orchestrators) and observability tools
Domain
Cloud computing / Infrastructure
Deliverable
production ML models | product features | infrastructure
Required skills
Go, Python, Rust, Linux systems administration, networking (TCP/IP, DNS, BGP, load-balancing), container orchestration, Infrastructure-as-Code (Ansible, Salt), relational databases (PostgreSQL), CI/CD pipelines, monitoring and logging tools (Prometheus, Grafana, Elastic)
Preferred skills
None stated
Technologies
Go, Python, Rust, Bash, Linux, Kubernetes, Docker, Ansible, Salt, AWX, Prometheus, Grafana, Elastic, GitLab, PostgreSQL
Responsibilities
Build and optimize tooling to automate monitoring, diagnosis, and remediation of production incidents; Troubleshoot high-impact production issues; Participate in on-call rotation to handle incidents; Implement and maintain observability solutions; Contribute to infrastructure lifecycle management; Maintain clear technical documentation; Collaborate with development teams to ensure infrastructure readiness
Seniority
Mid-level to Senior, hands-on IC