CareerPlanSign in

Member of Technical Staff - Multi-Modal, Audio

San Francisco💼 Full-time🗓 2025-12-16 → 2026-09-27

Core

Building frontier speech-language models (STT, TTS, speech-to-speech) that run efficiently on on-device hardware under real-time constraints.

Role type

Senior IC machine-learning engineer (audio)

Builds

Production-grade audio models, data pipelines, and evaluation systems for on-device deployment

Domain

Consumer electronics, automotive, life sciences, financial services

Deliverable

production ML models

Required skills

PyTorch, distributed training frameworks (DeepSpeed, FSDP), production-grade code, data pipeline engineering, evaluation system design, model fine-tuning

Preferred skills

Audio/speech model experience (ASR, TTS, vocoders, diarization), large-scale distributed GPU training, open-source contributions

Technologies

PyTorch, DeepSpeed, FSDP

Responsibilities

Build and scale data pipelines for audio model training; Design and maintain evaluation systems for multimodal performance; Fine-tune and adapt audio models for customer-specific use cases; Contribute production code to the core audio repository; Support experimentation under real hardware constraints

Seniority

Senior, hands-on IC

Sourced via ashby · Listed on CareerPlan, which tracks 814,000+ jobs from 20+ sources.