ML Infrastructure Engineer
Core
Build and maintain foundational ML infrastructure for robot manipulation, including training systems, inference pipelines, and data processing for home robotics.
Role type
Senior ML Infrastructure Engineer
Builds
Distributed training clusters, low-latency inference pipelines, and high-throughput multimodal data pipelines for robot learning
Domain
Robotics, Machine Learning, Distributed Systems
Deliverable
production ML models | infrastructure
Required skills
Distributed systems design, ML training infrastructure, GPU cluster management, Data pipeline engineering, Performance optimization, System ownership
Preferred skills
Robotics data pipelines, Multimodal models, Training compilers, GPU performance tuning, Serialization formats (Protobuf, FlatBuffers)
Technologies
PyTorch, Kubernetes, SLURM, GPU clusters
Responsibilities
Maintain research codebase ergonomics, Own model training infrastructure (scheduling, checkpointing, logging), Scale distributed training across GPU clusters, Build low-latency inference pipelines for real-time control, Design high-throughput data ingestion and transformation pipelines, Build research tooling for debugging and experiment analysis
Seniority
Senior, hands-on IC