Sr. Staff Platform/Data Reliability Engineer, Databricks (R5537)
Core
Own operational excellence, monitoring, alerting, observability, and incident response for the Databricks platform and data jobs.
Role type
Sr. Staff Platform/Data Reliability Engineer
Builds
Databricks platform services, data pipelines, and production runbook patterns
Domain
Defense technology / Cloud data infrastructure
Deliverable
production ML models | infrastructure
Required skills
Databricks platform operations, CI/CD for data assets, observability and monitoring, incident management, compute policy design, workload isolation, service principals, regulated environment compliance, platform health metrics tracking, mentorship
Preferred skills
Databricks certification, Delta Lake, Unity Catalog, Workflows, Databricks Asset Bundles, infrastructure-as-code, commercial/government environment support, defense/aerospace/federal industry experience
Technologies
Databricks, Delta Lake, Unity Catalog, Workflows, Databricks Asset Bundles, CI/CD tools
Responsibilities
Define and maintain CI/CD and promotion standards for Databricks assets; Design and maintain platform standards for job orchestration and compute policies; Establish reusable operational templates for new domains; Partner with data engineers on ingestion and medallion patterns; Work with cloud/infrastructure teams to align configurations; Enforce technical controls for data segregation and access boundaries; Track and improve platform health metrics; Document platform standards and support models; Mentor internal engineers
Seniority
Sr. Staff, hands-on IC with mentorship