Site Reliability Engineer (expérimenté, CDI)
Core
Maintaining, optimizing, and securing production IT infrastructures and systems to ensure maximum availability and resilience for critical services.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Production systems, applications, and automated deployment/monitoring pipelines
Domain
IT Infrastructure, Cloud, DevOps
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Linux/Unix server management, network administration, monitoring and alerting tools (Prometheus, Grafana, Datadog, ELK), scripting (Python, Bash), CI/CD tools (Jenkins, GitLab CI, GitHub Actions), Infrastructure-as-Code (Terraform, Ansible), cloud platforms (AWS, GCP, Azure), microservices and container orchestration (Docker, Kubernetes), SQL and NoSQL database administration, incident diagnosis and resolution, capacity and cost management, SLI/SLO/SLA definition.
Preferred skills
DevOps engineering experience, software development background, observability implementation, agile methodologies, stress management during critical incidents.
Technologies
Prometheus, Grafana, Datadog, ELK Stack, Python, Bash, Jenkins, GitLab CI, GitHub Actions, Terraform, Ansible, AWS, GCP, Azure, Docker, Kubernetes, SQL, NoSQL
Responsibilities
Maintain operational status of production systems and applications, automate repetitive tasks and deployment processes, design solutions to improve system reliability and reduce failure rates, analyze incidents and manage emergencies to reduce MTTR, optimize application and infrastructure performance, collaborate with development teams to integrate SRE practices, create and track metrics for system reliability and performance.
Seniority
Senior, hands-on IC