CareerPlanSign in

ML Infrastructure Engineer

Redwood City, CA💼 Full-time🗓 2026-02-11 → 2026-09-26

Core

Build and maintain foundational ML infrastructure for robot manipulation, including training systems, inference pipelines, and data processing for home robotics.

Role type

Senior ML Infrastructure Engineer

Builds

Distributed training clusters, low-latency inference pipelines, and high-throughput multimodal data pipelines for robot learning

Domain

Robotics, Machine Learning, Distributed Systems

Deliverable

production ML models | infrastructure

Required skills

Distributed systems design, ML training infrastructure, GPU cluster management, Data pipeline engineering, Performance optimization, System ownership

Preferred skills

Robotics data pipelines, Multimodal models, Training compilers, GPU performance tuning, Serialization formats (Protobuf, FlatBuffers)

Technologies

PyTorch, Kubernetes, SLURM, GPU clusters

Responsibilities

Maintain research codebase ergonomics, Own model training infrastructure (scheduling, checkpointing, logging), Scale distributed training across GPU clusters, Build low-latency inference pipelines for real-time control, Design high-throughput data ingestion and transformation pipelines, Build research tooling for debugging and experiment analysis

Seniority

Senior, hands-on IC

Sourced via ashby · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.