Site Reliability Engineer - Data, Cloud & Developer Experience
Core
Improving reliability of systems and services through SRE practices, observability tooling, and incident management for Blackstone's investment platforms.
Role type
Senior Site Reliability Engineer (Data, Cloud & Developer Experience)
Builds
Observability systems, deployment pipelines, and automated SRE tooling for investment vehicles.
Domain
Alternative asset management / Private Equity / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
SRE methodologies, observability standards, automation scripting, public cloud management, configuration-as-code, container orchestration, Linux/Windows troubleshooting, incident management, postmortem analysis
Preferred skills
Azure experience, AI assistant usage, cost optimization strategies
Technologies
AWS, Azure, Terraform, Puppet, Gitlab CI, Docker, AWS ECS, AWS EKS, Grafana, Prometheus, Splunk, Python, C#, Typescript
Responsibilities
Provide technical leadership in SRE methodologies, incorporate observability standards into pipelines, evolve SRE standards across teams, partner to improve service reliability, implement instrumentation and performance insights, ensure monitoring reflects service reliability, implement strategic observability tools, participate in on-call rotations, use automation to manage SRE systems, foster blameless culture in postmortems
Seniority
Senior, hands-on IC