Site Reliability Engineer (expérimenté, CDI)
Core
Maintaining, optimizing, and securing production IT infrastructure and systems to ensure maximum availability and resilience for critical services.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Production systems, automated deployment pipelines, and monitoring solutions
Domain
Cloud infrastructure, DevOps, and system reliability
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Linux/Unix system administration, cloud platforms (AWS, GCP, Azure), container orchestration (Docker, Kubernetes), infrastructure-as-code (Terraform, Ansible), CI/CD tools (Jenkins, GitLab CI, GitHub Actions), monitoring and alerting (Prometheus, Grafana, Datadog, ELK Stack), SQL and NoSQL database administration, incident management and root cause analysis, scripting (Python, Bash)
Preferred skills
DevOps engineering experience, agile methodologies, observability practices, stress management during critical incidents
Technologies
Prometheus, Grafana, Datadog, ELK Stack, Jenkins, GitLab CI, GitHub Actions, Terraform, Ansible, AWS, GCP, Azure, Docker, Kubernetes, Python, Bash
Responsibilities
Maintain operational status of production systems and applications, automate repetitive tasks and deployment processes, design solutions to improve system reliability, analyze incidents and manage emergencies, optimize application and infrastructure performance, collaborate with development teams on DevOps practices, create and track reliability metrics (SLI, SLO, SLA), stay updated on SRE tools and processes
Seniority
Senior, hands-on IC