Machine Learning Engineer, Speech - Joint Audio-Video Modeling
Core
Build state-of-the-art speech and audio generation systems end-to-end, focusing on joint audio-video modeling to make characters speak, sing, and emote in sync with video.
Role type
Senior IC machine learning engineer (joint audio-video generation)
Builds
Joint audio-video generative models, voice cloning, multi-speaker conditioning, and cinematic dialogue systems
Domain
Generative AI, Speech & Audio, Multimodal Systems
Deliverable
production ML models
Required skills
Large-scale audio model development (>8B params), diffusion and flow-matching transformers, audio VAEs and neural codecs, multi-GPU distributed training, PyTorch, voice cloning, speech control/steerability
Preferred skills
Multimodal audio-video modeling, video generation (diffusion/flow-matching), streaming or real-time generation, causal distillation
Technologies
PyTorch, CUDA, Triton, C++, FSDP, DeepSpeed
Responsibilities
Design and train audio representations (VAEs, codecs), architect generative backbones, design joint audio-video alignment, run scientific experiments, define data requirements and curation strategies, design rigorous evaluation metrics, optimize inference efficiency, harden training/inference pipelines, partner on GPU scaling, lead small research projects, develop dev tooling, contribute to safety guardrails
Seniority
Senior, hands-on IC