CareerPlanSign in

Site Reliability Engineer - Production Management

USA💼 Full-time💰 $61,000–$61,000🗓 2026-09-09 → 2026-09-26

Core

Guide and support peers in building design approaches, design and implement deployment/reliability solutions using CI/CD, monitor operational signals, drive rapid response to incidents, and lead L1/L2 production support using SRE practices.

Role type

Senior IC Site Reliability Engineer (Production Management)

Builds

Production services, automated CI/CD pipelines, observability dashboards, and self-service tools for the Commercial & Investment Bank.

Domain

Financial services (markets, pricing, risk) + Cloud/AI

Deliverable

production ML models | product features | dashboards & analysis | infrastructure

Required skills

Site Reliability Engineering (SRE) culture and principles, Python/Java/.NET programming, AWS production support, incident discipline, debugging distributed systems, automation scripting, stakeholder communication

Preferred skills

Markets experience (pricing, risk, market data), Fixed Income experience, Datadog (metrics/logs/traces/SLOs), messaging/streaming patterns (Kafka/MQ), AI-assisted tooling for support toil reduction

Technologies

AWS, Datadog, Kafka, Python, Java, Spring Boot, ASP.NET, CI/CD, Cloud, Android, Security

Responsibilities

Guide peers in SRE best practices, design and implement reliability solutions via CI/CD, monitor operational signals and drive rapid incident response, improve observability and alert quality, own and refine the support operating model (runbooks, escalations, shift coverage), partner on root-cause fixes and automation, lead L1/L2 production support triage and mitigation, apply AI capabilities to identify reliability risks and patterns

Seniority

Senior, hands-on IC

Sourced via devitjobs · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.