CareerPlanGet AI match score →

Site Reliability Engineer (SRE)

Korea💼 Full-time🗓 2026-07-27

Core

Lead incident response and reliability engineering for Tmap Mobility's enterprise services, ensuring infrastructure stability and operational maturity.

Role type

Senior Site Reliability Engineer (SRE)

Builds

AWS multi-account + EKS production infrastructure, observability pipelines, and standardized deployment/change management processes.

Domain

Cloud Infrastructure (AWS, EKS) and Observability

Deliverable

production ML models | infrastructure

Required skills

Incident management and RCA, AWS operations, Observability platform usage, Server/Network troubleshooting, System interdependency analysis, Chaos Engineering planning

Preferred skills

High-traffic service operations, SLI/SLO/Error Budget management, Java/Spring performance analysis, LLM/Agent development and operations, Post-mortem culture establishment, Deployment/Change management automation

Technologies

AWS, EKS, Datadog, Claude Code, Codex

Responsibilities

Lead first-line response and RCA for enterprise service incidents, Manage post-mortems and prevent recurrence action items, Establish and standardize on-call/incident response systems, Define SLI/SLOs and quantify reliability metrics, Manage service operational maturity and production checklists, Standardize deployment/change management processes including impact analysis and risk review, Plan chaos engineering training and risk diagnostics

Seniority

Senior, hands-on IC

Rewrite
## About the role 티맵모빌리티의 DevOps팀을 소개합니다! DevOps팀은 전사 서비스의 인프라·배포·안정성을 책임지고 있습니다. AWS 멀티 어카운트 + EKS 기반 프로덕션 인프라를 운영하며, Datadog 옵저버빌리티, Claude Code·Codex 등 AI 도구를 적극 활용합니다. 개발팀과 장애 대응부터 아키텍처 리뷰까지 함께합니다. ## 담당업무 - 전사 서비스 장애의 1 차 대응 및 RCA 리드를 합니다. - 포스트모템 및 재발 방지 액션 아이템 추적 관리를 합니다. - 온콜/인시던트 체계를 수립 및 표준화 합니다. - SLI/SLO 정의 및 신뢰성을 데이터 정량화 합니다. - 서비스 운영 성숙도 관리 - 서비스 레벨에 따른 프로덕션 필수 점검항목을 정의 및 관리합니다. - 전사 배포/변경 관리 표준화를 합니다. (배포 전 영향도 분석, 리스크 검토) - 장애 리스크 사전 진단 및 Chaos Engineering 훈련을 기획합니다. ## Who We're Looking For ### 지원자격 - SRE 또는 인프라 운영 관련 실무 5 년 이상이거나 이에 준하는 경험을 보유하신 분 - AWS 운영 경험 3 년 이상의 경험을 보유하신 분 - 여러 계층에 걸친 IT 서비스 장애를 1 차 대응부터 RCA, 재발방지까지 끝까지 추적, 해결한 경험을 보유하신 분 - 옵저버빌리티 플랫폼을 활용한 장애 진단 및 분석 경험을 보유하신 분 - 서버/네트워크 레벨 장애 진단 역량을 보유하신 분 - 시스템간 연동 구조 분석 및 장애 영향도 평가 경험을 보유하신 분 ### Preferred Qualifications - 대규모/대용량 트래픽 서비스 운영 경험을 보유하신 분 - SLI/SLO/에러 버짓 운영 경험을 보유하신 분 - Java/Spring 애플리케이션 성능 분석 경험을 보유하신 분 - LLM/에이전트를 개발·운영·진단에 활용해 본 경험을 보유하신 분 - 옵저버빌리티 플랫폼으로 서비스 품질을 상시 관측 및 개선한 경험을 보유하신 분 - 포스트모템 문화 정착 경험을 보유하신 분 - 배포/변경관리 프로세스 설계 또는 자동화 경험을 보유하신 분 ## Recruiting Process ### 전형절차 - 서류 > 코딩테스트 > 1 차 인터뷰 > 2 차 인터뷰 > 레퍼런스 체크 > 처우협의 및 채용검진 > 최종합격 - 상기 채용 전형은 상황에 따라 생략/추가될 수 있습니다. ## Please Read Before Applying ### 참고사항 - 첨부파일에는 연봉 정보를 별도로 기입하지 마시고, 지원서에 있는 연봉 정보 기입칸에만 작성해주세요. - 모든 직무는 3 개월의 시용기간이 적용되며, 평가에 따라 통과 또는 채용 취소가 가능합니다. (해당 기간 동안 급여는 100% 지급됩니다) - 본 공고는 채용 완료 시 조기 종료될 수 있습니다. - 국가 등록 장애인 및 국가 보훈 대상자는 관련 법규에 의거하여 우대합니다. - 궁금하신 부분은 [email protected] 으로 언제든지 편하게 연락 주세요 :) ## See more jobs from the same company - View more - See more similar job openings - View more - See more jobs in the same region
Sourced via skcareers · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.
Apply on Skcareers ↗