Especialista de SRE
Core
Ensure reliability and resilience of critical Identity & Fraud products in a large-scale technology environment by defining SLOs, automating infrastructure, and managing incidents.
Role type
Senior Site Reliability Engineer (SRE)
Builds
High-availability Identity & Fraud systems on modern cloud platforms
Domain
Fintech / Identity & Fraud / Cloud Infrastructure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Kubernetes, Docker, AWS/OCI/Azure/GCP, Terraform, Ansible, Datadog, Prometheus, ELK, Grafana, CI/CD, Infrastructure as Code, Distributed Systems Troubleshooting, Capacity Planning
Preferred skills
Chaos Engineering, Resilience Testing, Application Security, Relational/NoSQL Databases, Cloud Certifications
Technologies
Kubernetes, Docker, AWS, OCI, Azure, GCP, Terraform, Ansible, Datadog, Prometheus, ELK, Grafana
Responsibilities
Define and monitor SLIs, SLOs, and SLAs; Lead incident analysis and implement preventive actions; Automate provisioning, deployment, scaling, and failure-recovery processes; Design and maintain observability solutions; Support capacity and performance engineering; Contribute to architectural improvements for resilience and security; Troubleshoot and mitigate issues in real-time production environments.
Seniority
Senior, hands-on IC