Site Reliability Engineer, Cloud Cost Utilization
Core
Making cloud spending visible, understandable, and actionable across GitLab's infrastructure by building systems for cost tracking, attribution, and optimization.
Role type
Senior IC Site Reliability Engineer (Cloud Cost Utilization)
Builds
Cloud billing data pipelines, cost anomaly detection workflows, and observability tooling for AWS and GCP.
Domain
Cloud Infrastructure / FinOps
Deliverable
production ML models | product features | dashboards & analysis
Required skills
Cloud cost management (AWS/GCP), FinOps FOCUS specification, resource tagging strategies, Infrastructure as Code (Terraform/Ansible), Observability stacks (Prometheus/LGTM/ELK), Data pipeline development
Preferred skills
Cross-functional collaboration with Finance/Engineering, Explaining technical data to non-engineering audiences, Self-directed work in async environments
Technologies
AWS, GCP, Terraform, Ansible, Prometheus, Loki, Grafana, Tempo, Mimir, ELK, FOCUS
Responsibilities
Design and maintain cloud resource tagging and labeling strategies; Develop tooling to ingest and normalize cloud billing data; Automate cost anomaly detection and forecasting; Contribute to observability stacks to surface cost signals; Partner with leadership on cloud cost forecasting; Act as SME for cloud cost attribution; Collaborate on audits and financial reporting.
Seniority
Senior, hands-on IC