多模态算法工程师(J15136)
Core
Designing and optimizing multimodal large models (VLM/LLM) for real-world business applications including image understanding, visual question answering, cross-modal retrieval, and content generation.
Role type
Senior IC multimodal algorithm engineer
Builds
Production multimodal systems combining traditional CV with large language models
Domain
Artificial Intelligence / Multimodal AI / Computer Vision
Deliverable
production ML models
Required skills
Multimodal large model development, LLM engineering, PyTorch, traditional computer vision (detection, segmentation, OCR), prompt optimization, agent/tool orchestration, inference optimization, SFT, RL, post-training
Preferred skills
Real-world project deployment experience, multi-card training optimization, business metric alignment
Technologies
PyTorch, VLM, LLM, OCR, CV frameworks
Responsibilities
Optimize multimodal models for business scenarios, design inference pipelines, build hybrid CV+LLM systems, construct evaluation frameworks, adapt models to specific domains
Seniority
Mid-Senior, hands-on IC