Solutions Reliability Engineer III
Core
Design, develop, and support monitoring, observability, automation, and AI-assisted operational solutions to improve reliability and efficiency for business stakeholders.
Role type
Senior IC Solutions Reliability Engineer
Builds
Production ML models, automation workflows, and intelligent operational systems
Domain
Financial services / Cloud infrastructure / Observability
Deliverable
production ML models | product features | infrastructure
Required skills
Reliability engineering, Cloud technologies, Observability, AI and agentic operational practices, Problem Management, Incident Management, ITIL Service Management, Continuous Improvement methodologies, Data analysis, Automation design
Preferred skills
Experience with Datadog, Splunk, Machine learning models, Agentic systems
Technologies
Datadog, Splunk, Machine learning models, Agentic systems
Responsibilities
Design and develop monitoring, observability, and automation solutions; Coordinate delivery of complex integration test environments; Facilitate Problem Management and analyze Production Incidents; Respond to complex major Production Incidents; Gather and analyze operational metrics and telemetry to predict issues; Provide technical guidance and coaching to less experienced engineers; Leverage AI-assisted analysis for root cause identification.
Seniority
Senior, hands-on IC