CareerPlanGet AI match score →

Member of Technical Staff, AI Reliability & Monitoring Engineering Lead

San Francisco, California💼 Full-time💰 $256,000–$256,000🗓 2026-06-02 → 2026-07-31

Core

Define, build, and maintain infrastructure and processes ensuring reliability, scalability, and performance of Postman's AI-powered API and agentic systems in production.

Role type

Senior IC AI Systems Reliability Engineer (SRE)

Builds

High-availability AI infrastructure, observability systems, and automated incident response tools for API and agentic platforms.

Domain

Cloud infrastructure, AI/ML systems, API platforms

Deliverable

production ML models | infrastructure

Required skills

AI reliability engineering, SRE, distributed systems, SLO definition, observability, incident response automation, GPU/xPU optimization, cloud platforms, resource utilization optimization

Preferred skills

API platform operations, building observability tools for agentic systems, open-source contributions

Technologies

GPU/xPU, cloud platforms, monitoring tools

Responsibilities

Develop and manage reliability metrics (SLOs) for AI-driven API services; Implement comprehensive observability and monitoring systems; Design automated failover and recovery strategies; Optimize GPU/accelerator efficiency; Lead internal tooling and automation for AI system stability; Drive continuous improvement in deployment and incident management practices.

Seniority

Senior, hands-on IC

Sourced via greenhouse · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.
Apply on Greenhouse ↗