Senior Applied Scientist - Multimodal
Core
Building scalable audio/video dataset pipelines and lip sync models to support filmmakers in editing, localizing, and refining performances while preserving artistic intent.
Role type
Senior Applied Scientist (Multimodal Audio/Video)
Builds
Audio/video dataset curation pipelines, lip sync model training workflows, and evaluation metrics for film production tools.
Domain
Entertainment technology, Audio processing, 3D Computer Vision, Speech Synthesis, Computer Graphics
Deliverable
production ML models
Required skills
Deep learning frameworks (PyTorch), Python, Computer Science fundamentals, Audio processing, 3D Computer Vision, Speech Synthesis, Computer Graphics, Multimodal data handling
Preferred skills
Product mindset, Data workflow automation, Model evaluation design
Technologies
PyTorch, OpenCV
Responsibilities
Develop repeatable, scalable audio/video dataset curation pipelines and lip sync model training workflows; Design, automate, and maintain audio/video datasets and lip sync metric testing pipelines; Partner with researchers to support ongoing and future research initiatives.
Seniority
Senior, hands-on IC