Site Reliability Engineer
Core
Ensuring availability, reliability, and performance of cloud and network systems by automating routine manual tasks and managing production environments.
Role type
Site Reliability Engineer (SRE)
Builds
Automated solutions for system access monitoring, log session recording, and reliability administration across distributed data centers.
Domain
Cloud infrastructure and network systems
Deliverable
production ML models | infrastructure
Required skills
Python, Java, API design, GCP, Full Stack development, Dynatrace
Preferred skills
DevOps, System Design, AI Ops, Observability, Cloud Engineering
Technologies
Dynatrace, Python, Java, GCP, Kibana, Splunk, Grafana
Responsibilities
Monitor and manage production environments; build advanced tooling for system monitoring and log recording; engage with engineering teams to improve incident management and on-call efficiencies; perform capacity planning and optimization; maintain alerting systems for proactive health checks; create and maintain comprehensive documentation.
Seniority
Senior, hands-on IC