Site Reliability Engineer
Core
Provide production support, monitoring, and reliability engineering for Java microservices and cloud platforms.
Role type
Site Reliability Engineer (SRE)
Builds
Java microservices, J2EE web applications, and cloud-based systems on AWS, Azure, and PCF.
Domain
Cloud infrastructure, Java enterprise applications, and database operations.
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Java, Unix/Linux, PL/SQL, Postgres, Oracle, Kubernetes, Ansible, Chef, Jenkins, JVM debugging, JBoss, WebSphere, AWS, Azure, PCF, capacity planning, system design consulting, automation.
Preferred skills
ITIL, Incident Management, Change Management, Problem Management, multi-threading, batch processing, system health monitoring.
Responsibilities
Analyze ITSM activities and provide feedback to development teams; support services pre-launch via system design consulting and capacity planning; maintain live services by monitoring availability and latency; scale systems sustainably through automation; evolve systems to improve reliability and velocity.
Seniority
Mid-level, hands-on IC