Staff Software Engineer, Reliability
Core
Own reliability across the entire Metropolis platform, ensuring system availability, resilience, and observability for mission-critical mobility infrastructure.
Role type
Staff Software Engineer (Reliability/SRE)
Builds
Foundational infrastructure for mobility commerce, including failover systems, observability platforms, and resilience patterns.
Domain
Mobility, Parking, Real Estate, Cloud Infrastructure
Deliverable
production ML models | product features | infrastructure
Required skills
Reliability Engineering, Distributed Systems Architecture, Cloud Operations (AWS), Observability (Datadog), Incident Management, Database Replication, Chaos Engineering, JVM Performance, AI-powered coding tools
Preferred skills
Scala, SRE at hyperscale (Google/Amazon/Netflix), Incident Response Leadership, Performance Optimization, Open Source Contributions
Technologies
AWS, Datadog, Scala, Java, TypeScript, React, MySQL, PostgreSQL, Snowflake, Git, GitHub Copilot
Responsibilities
Design automatic failover mechanisms for external dependencies; Architect regional deployment strategies with database replication; Establish comprehensive monitoring and SLO-based alerting; Own incident management processes and MTTR reduction; Drive adoption of resilience patterns and chaos engineering; Build local mirrors for critical dependencies.
Seniority
Staff, hands-on IC with strategic influence