Site Reliability Engineer - Production Management
Core
Guide and support peers in building design approaches, design and implement deployment/reliability solutions using CI/CD, monitor operational signals, drive rapid response to incidents, and lead L1/L2 production support using SRE practices.
Role type
Senior IC Site Reliability Engineer (Production Management)
Builds
Production services, automated CI/CD pipelines, observability dashboards, and self-service tools for the Commercial & Investment Bank.
Domain
Financial services (markets, pricing, risk) + Cloud/AI
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Site Reliability Engineering (SRE) culture and principles, Python/Java/.NET programming, AWS production support, incident discipline, debugging distributed systems, automation scripting, stakeholder communication
Preferred skills
Markets experience (pricing, risk, market data), Fixed Income experience, Datadog (metrics/logs/traces/SLOs), messaging/streaming patterns (Kafka/MQ), AI-assisted tooling for support toil reduction
Technologies
AWS, Datadog, Kafka, Python, Java, Spring Boot, ASP.NET, CI/CD, Cloud, Android, Security
Responsibilities
Guide peers in SRE best practices, design and implement reliability solutions via CI/CD, monitor operational signals and drive rapid incident response, improve observability and alert quality, own and refine the support operating model (runbooks, escalations, shift coverage), partner on root-cause fixes and automation, lead L1/L2 production support triage and mitigation, apply AI capabilities to identify reliability risks and patterns
Seniority
Senior, hands-on IC