Sr. Site Reliability Engineer (Azure, IaC, Distributed Systems)
Core
Supporting deployment and configuration of monitoring and logging tools, automating routine operational tasks, and maintaining observability solutions across development, staging, and production environments.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Monitoring solutions, CI/CD pipelines, and cloud infrastructure configurations
Domain
Payments technology, Cloud Infrastructure (AWS, GCP), Observability
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Monitoring and logging tools configuration, Automation scripting, Observability stack management, CI/CD pipeline maintenance, Cloud infrastructure management, Infrastructure as Code, Containerization management, Troubleshooting and root cause analysis
Preferred skills
Documentation creation, First-level support, Workflow improvement suggestions, DevOps and SRE best practices application
Technologies
Splunk, ClickHouse, Grafana, Prometheus, OpenTelemetry, Fluent Bit, ElasticSearch, OpenSearch, CloudWatch, Terraform, Ansible, CloudFormation, Docker, Kubernetes, AWS, GCP, Generative AI tools