CareerPlanGet AI match score →

Analista de SRE Pleno

São Carlos, br💼 Full-time🗓 2026-07-07 → 2026-07-31

Core

Sustaining, evolving, and ensuring reliability of applications and infrastructure in an AWS environment.

Role type

Senior Site Reliability Engineer (SRE)

Builds

Production services with high availability, performance, and scalability

Domain

Cloud Infrastructure (AWS) and Distributed Systems

Deliverable

production ML models | infrastructure

Required skills

AWS services (EC2, EKS/ECS, RDS, S3, VPC, CloudWatch), Kubernetes, Docker, CI/CD pipelines, GitOps, Observability tools (Datadog, Dynatrace, Prometheus, Grafana, OpenTelemetry, ELK/OpenSearch), Infrastructure as Code (Terraform), Configuration Management (Ansible), Linux, Network protocols, Load balancing, Security fundamentals, Distributed system architecture, High availability, Fault tolerance, Scalability, Vulnerability management

Preferred skills

SLIs/SLOs/SLAs definition and management, Mission-critical environments, High volume/Low latency, Python/Go/Bash scripting, Helm, ArgoCD, Flux, FinOps, Database management (PostgreSQL, MySQL, MongoDB, Redis, Elasticsearch, DynamoDB), Capacity engineering, Infrastructure security (IAM, Secrets Management)

Technologies

AWS, Kubernetes, Docker, Terraform, Ansible, Datadog, Dynatrace, Prometheus, Grafana, OpenTelemetry, ELK, OpenSearch, Helm, ArgoCD, Flux, Python, Go, Bash, PostgreSQL, MySQL, MongoDB, Redis, Elasticsearch, DynamoDB

Responsibilities

Automate infrastructure provisioning and management using IaC, Respond to incidents and perform root cause analysis (RCA), Implement and evolve observability solutions (metrics, logs, traces, dashboards), Analyze performance bottlenecks and propose improvements, Collaborate with Development, Architecture, Security, and Product teams to disseminate reliability best practices

Seniority

Mid-Senior, hands-on IC

Sourced via smartrecruiters · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.
Apply on SmartRecruiters ↗