Staff Machine Learning Engineer, Computer Vision
Core
Building and training large-scale multimodal visual encoders and generative models to power Pinterest's recommender systems, visual language models, and image retrieval features.
Role type
Staff Machine Learning Engineer (Computer Vision & Multimodal)
Builds
In-house visual encoders, multimodal representations, and visual tokens for production ML models.
Domain
Computer Vision, Multimodal Representation Learning, Generative AI
Deliverable
production ML models
Required skills
Large-scale model training, deep learning frameworks (PyTorch), computer vision model development, multimodal representation learning, visual language modeling, research paper reading, open-source contributions, AI coding assistants (Cursor/Copilot/Codex)
Preferred skills
Visual reasoning tools development, instruction-tuned embedding and generative models, RL training reward function development
Technologies
PyTorch, large-scale GPU computing, visual encoders, VLMs
Responsibilities
Prototype state-of-the-art visual encoders, experiment with billion-scale datasets, build flexible visual reasoning tools, read research papers and brainstorm visual generative strategy, collect visual instruction training data, publish work at conferences, mentor junior researchers
Seniority
Staff, hands-on IC with mentorship