Member of Technical Staff - Multi-Modal, Audio
Core
Building frontier speech-language models (STT, TTS, speech-to-speech) that run efficiently on on-device hardware under real-time constraints.
Role type
Senior IC machine-learning engineer (audio)
Builds
Production-grade audio models, data pipelines, and evaluation systems for on-device deployment
Domain
Consumer electronics, automotive, life sciences, financial services
Deliverable
production ML models
Required skills
PyTorch, distributed training frameworks (DeepSpeed, FSDP), production-grade code, data pipeline engineering, evaluation system design, model fine-tuning
Preferred skills
Audio/speech model experience (ASR, TTS, vocoders, diarization), large-scale distributed GPU training, open-source contributions
Technologies
PyTorch, DeepSpeed, FSDP
Responsibilities
Build and scale data pipelines for audio model training; Design and maintain evaluation systems for multimodal performance; Fine-tune and adapt audio models for customer-specific use cases; Contribute production code to the core audio repository; Support experimentation under real hardware constraints
Seniority
Senior, hands-on IC