System Reliability Engineer, Consultant
Core
Ensure reliability, scalability, and performance of enterprise systems and services by applying software engineering principles to operations.
Role type
System Reliability Engineer (SRE)
Builds
Automation for monitoring, alerts, and recovery processes; internal tools to reduce manual toil.
Domain
Financial services / Regulated industries / Cloud infrastructure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Front-end performance monitoring, Real User Monitoring (RUM), Synthetic Monitoring, APM tools (Dynatrace, New Relic, Datadog), Dashboarding (Grafana, Prometheus, Elastic Stack, Splunk), OpenTelemetry, Python/Bash/JavaScript scripting, CI/CD pipelines, Cloud technologies (AWS/Azure), Docker, Kubernetes, Secure coding practices, Financial compliance standards (PCI-DSS)
Preferred skills
Experience supporting front-end applications in production environments
Technologies
Dynatrace, New Relic, Datadog, Grafana, Prometheus, Elastic Stack, Splunk, OpenTelemetry, Python, Bash, JavaScript, GitHub Flow, AWS, Azure, Docker, Kubernetes
Responsibilities
Monitor and report on application performance; Collaborate with developers to identify root causes and implement fixes; Participate in production incidents and outages; Automate operational tasks; Implement telemetry and observability practices; Analyze usage trends for capacity planning; Maintain operational documentation and runbooks
Seniority
Mid-level, hands-on IC

