Analista de SRE Pleno
Core
Sustaining, evolving, and ensuring reliability of applications and infrastructure in an AWS environment.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Production services with high availability, performance, and scalability
Domain
Cloud Infrastructure (AWS) and Distributed Systems
Deliverable
production ML models | infrastructure
Required skills
AWS services (EC2, EKS/ECS, RDS, S3, VPC, CloudWatch), Kubernetes, Docker, CI/CD pipelines, GitOps, Observability tools (Datadog, Dynatrace, Prometheus, Grafana, OpenTelemetry, ELK/OpenSearch), Infrastructure as Code (Terraform), Configuration Management (Ansible), Linux, Network protocols, Load balancing, Security fundamentals, Distributed system architecture, High availability, Fault tolerance, Scalability, Vulnerability management
Preferred skills
SLIs/SLOs/SLAs definition and management, Mission-critical environments, High volume/Low latency, Python/Go/Bash scripting, Helm, ArgoCD, Flux, FinOps, Database management (PostgreSQL, MySQL, MongoDB, Redis, Elasticsearch, DynamoDB), Capacity engineering, Infrastructure security (IAM, Secrets Management)
Technologies
AWS, Kubernetes, Docker, Terraform, Ansible, Datadog, Dynatrace, Prometheus, Grafana, OpenTelemetry, ELK, OpenSearch, Helm, ArgoCD, Flux, Python, Go, Bash, PostgreSQL, MySQL, MongoDB, Redis, Elasticsearch, DynamoDB
Responsibilities
Automate infrastructure provisioning and management using IaC, Respond to incidents and perform root cause analysis (RCA), Implement and evolve observability solutions (metrics, logs, traces, dashboards), Analyze performance bottlenecks and propose improvements, Collaborate with Development, Architecture, Security, and Product teams to disseminate reliability best practices
Seniority
Mid-Senior, hands-on IC