Ingénieur SRE H/F
Core
Ensure reliability, availability, and performance of IT services through observability tools and automation practices.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Production IT services and observability platforms
Domain
IT Operations / Cloud Infrastructure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Observability tools (Grafana, Prometheus), System/Network/Cloud environments, SRE concepts (SLA/SLO/SLI), Proactive incident analysis, Automation (Bash, Python)
Preferred skills
Incident management, Preventive actions, Cross-functional collaboration, Continuous improvement culture
Technologies
Grafana, Prometheus, Bash, Python
Responsibilities
Monitor IT systems and handle alerts per SLA/SLO, Diagnose and resolve incidents with app/infra teams, Implement preventive actions (optimization, tuning, scaling, patching), Evolve observability platform and dashboards, Identify system fragilities and propose corrective/preventive actions, Support dev/infra/business teams for service exploitability
Seniority
Senior, hands-on IC