CareerPlanSign in

Machine Learning Engineer, Speech - Joint Audio-Video Modeling

💼 Full-time💰 $200,000–$200,000🗓 2026-07-30 → 2026-09-26

Core

Build state-of-the-art speech and audio generation systems end-to-end, focusing on joint audio-video modeling to make characters speak, sing, and emote in sync with video.

Role type

Senior IC machine learning engineer (joint audio-video generation)

Builds

Joint audio-video generative models, voice cloning, multi-speaker conditioning, and cinematic dialogue systems

Domain

Generative AI, Speech & Audio, Multimodal Systems

Deliverable

production ML models

Required skills

Large-scale audio model development (>8B params), diffusion and flow-matching transformers, audio VAEs and neural codecs, multi-GPU distributed training, PyTorch, voice cloning, speech control/steerability

Preferred skills

Multimodal audio-video modeling, video generation (diffusion/flow-matching), streaming or real-time generation, causal distillation

Technologies

PyTorch, CUDA, Triton, C++, FSDP, DeepSpeed

Responsibilities

Design and train audio representations (VAEs, codecs), architect generative backbones, design joint audio-video alignment, run scientific experiments, define data requirements and curation strategies, design rigorous evaluation metrics, optimize inference efficiency, harden training/inference pipelines, partner on GPU scaling, lead small research projects, develop dev tooling, contribute to safety guardrails

Seniority

Senior, hands-on IC

Sourced via ashby · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.