Solutions Reliability Engineer III
Core
Designing, developing, and supporting monitoring, observability, automation, and AI-assisted operational solutions to improve reliability and efficiency for Application Services and product teams.
Role type
Senior IC Solutions Reliability Engineer (AI & Automation)
Builds
Production ML models, agentic systems, intelligent workflows, and observability tools
Domain
Financial Services / Cloud Infrastructure / AI & Observability
Deliverable
production ML models
Required skills
Reliability engineering, Cloud technologies, Observability, AI and agentic operational practices, Automation, Problem management, Incident management, ITIL Service Management, Data analysis, Continuous improvement methodologies
Preferred skills
Experience with Datadog, Splunk, Machine learning models, Agentic systems
Technologies
Datadog, Splunk, Machine learning models, Agentic systems
Responsibilities
Design and develop monitoring, observability, and automation solutions; Develop intelligent workflows to optimize operational efficiency; Coordinate delivery of complex integration test environments; Analyze production incidents and facilitate problem management to prevent reoccurrence; Respond to complex and major production incidents; Provide technical guidance and coaching to less experienced engineers; Gather and analyze operational metrics and telemetry to identify trends; Recommend improvements to solution design and resilience.
Seniority
Senior, hands-on IC