AI Research Engineer, Computer Vision & VLMs
Core
Develop visual intelligence for restaurant environments using computer vision and vision-language models to understand people, objects, activities, and events over time.
Role type
Senior IC AI Research Engineer (Computer Vision & VLMs)
Builds
Production-ready visual perception systems for real-world restaurant operations
Domain
Restaurant operations, Computer Vision, Vision-Language Models (VLMs), Embodied AI
Deliverable
production ML models
Required skills
Computer vision, Vision-language modeling, Deep learning, Video understanding, Dataset construction, Model evaluation, Python, PyTorch, Experimental design, Software engineering for research
Preferred skills
Autonomous driving, Robotics, Embodied AI, Model compression/distillation, Real-time inference optimization, Academic publications (CVPR, NeurIPS, etc.)
Technologies
PyTorch, Python, VLM frameworks
Responsibilities
Develop CV/VLM approaches for scene understanding, object detection, tracking, and activity recognition; Adapt and fine-tune models for visual grounding and temporal reasoning; Design training strategies including SFT and domain adaptation; Build datasets and annotation workflows; Create rigorous benchmarks for perception quality and robustness; Diagnose model failures and improve data/models; Partner on deploying efficient inference pipelines; Translate research advances into product capabilities.
Seniority
Senior, hands-on IC with research depth