Applied Research Scientist, AI Research
Core
Build multimodal understanding systems (vision-language) to enable Descript's AI editing agent to perceive and reason about video and audio content.
Role type
Senior Applied Research Scientist (AI/Multimodal)
Builds
Specialized models for AI editing features (Underlord agent perception, video/audio generation, evaluation benchmarks)
Domain
AI Research, Multimodal Learning, Video/Audio Editing
Deliverable
production ML models
Required skills
Deep learning algorithm design, PyTorch, rapid experimentation, experimental judgment, technical writing, PhD or Master's in deep learning
Preferred skills
Multimodal understanding, generative modeling (video/audio/images), post-training/fine-tuning of foundation models, building evaluation systems, shipping research to production
Technologies
PyTorch, foundation models
Responsibilities
Design vision-language systems for media perception, create benchmarks for editorial quality, build datasets including synthetic data, train specialized models, ship prototypes to production, define research directions
Seniority
Senior, hands-on IC with direction-setting