DevOps Engineer / Site Reliability Engineer (m/w/d)
Core
Ensure reliability, performance, and evolution of complex distributed systems through monitoring, automation, and operational support for public administration digitalization projects.
Role type
Senior DevOps / Site Reliability Engineer
Builds
Distributed services and platforms for German public administration
Domain
Public sector digitalization, cloud infrastructure, distributed systems
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Monitoring, automation, system design, capacity planning, 3rd-level operational support, distributed system debugging, performance measurement
Preferred skills
Container orchestration, distributed version control systems, SRE methodologies and culture
Technologies
Cloud environments, monitoring tools, debugging tools, performance measurement tools
Responsibilities
Capture and analyze OS and application metrics for performance optimization and troubleshooting; Improve services via consistent test and release procedures; Participate in system design consultation, platform management, and capacity planning; Develop sustainable systems and services through automation; Balance feature development with reliability via defined SLOs; Provide 3rd-level operational support and ensure continuous reliability of large distributed services; Participate in on-call rotations to ensure reliable system operation