Senior Engineering Manager, Site Reliability
Core
Lead the Site Reliability Engineering (SRE) function to improve reliability, operational maturity, and resilience of Upstart's AI lending platform serving millions of borrowers.
Role type
Senior Engineering Manager, Site Reliability Engineering
Builds
Reliable, observable, and resilient systems for an AI lending marketplace
Domain
Fintech / AI Lending / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
Reliability engineering management, distributed systems, cloud infrastructure, observability, incident management, team leadership, strategic planning
Preferred skills
Service-level objectives, error-budget practices, Kubernetes, AWS, cloud native architectures, operational readiness programs
Technologies
Datadog, Grafana, Prometheus, OpenTelemetry, Kubernetes, AWS
Responsibilities
Manage and develop the SRE team; define strategy, roadmap, and measurable outcomes for the SRE function; lead high severity incident response and improve incident management practices; improve observability signals and reduce operational toil; establish operational readiness standards for new services and major launches
Seniority
Senior, hands-on leader with management responsibilities