Site Reliability Engineer -Jersey City, NJ & Dallas, TX
Core
Advancing Site Reliability Engineering (SRE) practices for production applications by integrating production support expertise earlier in the lifecycle to influence design, validate reliability requirements, and drive operational improvement.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Production-ready applications with high availability, observability, and automated recovery
Domain
Financial services / Capital markets / Regulated environments
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
SRE practices, observability platform design, automation scripting (Python/Java/Go/PowerShell), incident response, root cause analysis, capacity planning, disaster recovery, reliability metrics governance, AI-assisted remediation, distributed systems knowledge
Preferred skills
SRE/observability/automation/ITIL certifications, experience with financial services or regulated environments, knowledge of AI concepts and anomaly detection
Technologies
Python, Java, Go, PowerShell, distributed applications, middleware, messaging systems, batch processing, real-time processing
Responsibilities
Define and validate reliability requirements including resiliency, observability, and disaster recovery; improve monitoring, observability, and alert strategies to accelerate incident response; lead capacity, performance, and resiliency analysis; establish and track reliability metrics; promote SRE practices through mentoring and standards adoption; prepare executive reporting on reliability posture and operational risks
Seniority
Senior, hands-on IC with mentorship responsibilities