CareerPlanSign in

多模态算法工程师(J15136)

北京市💼 Full-time🗓 2026-07-21 → 2026-09-28

Core

Designing and optimizing multimodal large models (VLM/LLM) for real-world business applications including image understanding, visual question answering, cross-modal retrieval, and content generation.

Role type

Senior IC multimodal algorithm engineer

Builds

Production multimodal systems combining traditional CV with large language models

Domain

Artificial Intelligence / Multimodal AI / Computer Vision

Deliverable

production ML models

Required skills

Multimodal large model development, LLM engineering, PyTorch, traditional computer vision (detection, segmentation, OCR), prompt optimization, agent/tool orchestration, inference optimization, SFT, RL, post-training

Preferred skills

Real-world project deployment experience, multi-card training optimization, business metric alignment

Technologies

PyTorch, VLM, LLM, OCR, CV frameworks

Responsibilities

Optimize multimodal models for business scenarios, design inference pipelines, build hybrid CV+LLM systems, construct evaluation frameworks, adapt models to specific domains

Seniority

Mid-Senior, hands-on IC

Sourced via baidu · Listed on CareerPlan, which tracks 845,000+ jobs from 20+ sources.