Senior Site Reliability Engineer
Core
Senior SRE focused on AWS cost optimization, FinOps practices, and infrastructure efficiency for a cloud platform.
Role type
Senior Site Reliability Engineer (FinOps & Cloud Efficiency)
Builds
Cloud infrastructure cost savings, automation dashboards, and operational guardrails for AWS environments.
Domain
Cloud Infrastructure / FinOps / AWS
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
AWS services (EC2, S3, RDS, Lambda, CloudWatch), FinOps practices, Infrastructure-as-Code (Terraform, Ansible), Python/Go/Shell scripting, Linux systems, Observability (Prometheus, Grafana, Splunk), Capacity planning, Incident management
Preferred skills
FinOps certification, AWS Savings Plans/Reserved Instances/Spot adoption, Cloud cost management tools (Cost Explorer, CUR), Large-scale SaaS platform experience, Data platforms (EMR, Kafka, Spark), AI/ML infrastructure cost optimization
Technologies
AWS, Terraform, CloudFormation, Puppet, Ansible, Python, Go, Shell, CloudWatch, OpenSearch, Prometheus, Grafana, Splunk, ThousandEyes, Datadog, EMR, Kafka, Airflow, Spark, Redis, Cassandra
Responsibilities
Own and drive AWS cost optimization initiatives; Analyze cloud usage to identify savings; Drive FinOps practices including budgeting and anomaly detection; Build automation and dashboards for cost governance; Improve resource utilization through right-sizing and autoscaling; Mentor engineers and drive cross-functional initiatives
Seniority
Senior, hands-on IC with mentorship responsibilities