Senior Software Engineer, Site Reliability
Core
Building tooling and automation to monitor the health of Upstart's production infrastructure, ensuring reliability, resiliency, and observability for a high-scale AI lending platform.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Internal observability tooling, automation for incident response, and monitoring standards for microservices and ML platforms.
Domain
Fintech / AI Lending / Cloud Infrastructure
Deliverable
infrastructure
Required skills
Python, Go, JavaScript/TypeScript, Infrastructure as Code (Terraform, CDK, CloudFormation), software design & architecture, data structures & algorithms, on-call/incident management, observability tooling (Datadog, Sumologic), microservices architecture, SaaS support.
Preferred skills
Service mesh, full stack development, observability platform tooling, LLM/GenAI for SRE efficiency.
Technologies
Kubernetes, Terraform, CDK, CloudFormation, Datadog, Sumologic, Python, Go, JavaScript/TypeScript.
Responsibilities
Implement standards for monitoring microservices, web apps, mobile apps, databases, and Kubernetes clusters; improve incident response practices; automate toil; uphold SRE principles and culture of ownership.
Seniority
Senior, hands-on IC