Monitoring and Observability Engineer
Core
Design and maintain robust observability infrastructure, implementing monitoring standards, KPIs, and real-time data pipelines to ensure system reliability and enhance user experience.
Role type
Senior IC Monitoring and Observability Engineer
Builds
Production monitoring solutions, event streaming pipelines, and AI-driven alerting systems
Domain
Semiconductor / Cloud Infrastructure / Observability
Deliverable
production ML models | infrastructure
Required skills
Prometheus, Grafana, Nagios, SolarWinds, Apache Kafka, Bash, Python, Go, Linux system administration, Infrastructure-as-Code (Terraform, Ansible), SLO/SLA definition, performance optimization
Preferred skills
Kubernetes monitoring, OpenTelemetry, APM tools, cloud platforms (AWS, Azure, GCP), incident response, open-source contributions
Technologies
Prometheus, Grafana, Nagios, SolarWinds, Apache Kafka, Terraform, Ansible, Docker, Kubernetes, AWS CloudWatch, Azure Monitor
Responsibilities
Implement and manage KPI/Metrics standards; Deploy monitoring solutions using industry-leading tools; Develop Kafka-based event streaming pipelines; Integrate AI monitoring capabilities for anomaly detection; Create documentation and runbooks; Develop custom automation scripts; Establish and refine SLAs/SLOs; Optimize monitoring infrastructure performance
Seniority
Senior, hands-on IC