CareerPlanSign in

微信-多模态大模型算法工程师-OCR与文档理解方向(北京)

Shenzhen, China💼 Full-time🗓 2026-09-28

Core

Develop and deploy multimodal large models for OCR and document understanding to support WeChat's C-end applications, search, recommendation, and review systems across Video Accounts, Official Accounts, and WeChat Stores.

Role type

Senior IC multimodal large model algorithm engineer (OCR & document understanding)

Builds

Multimodal large models for search, recommendation, and content review

Domain

Consumer internet + computer vision + document intelligence

Deliverable

production ML models

Required skills

multimodal large model architecture design, large-scale data construction/cleaning/governance, distributed model training, pretraining, supervised fine-tuning (SFT), alignment (RLHF/DPO), OCR, table recognition, layout analysis, key information extraction (KIE), Python, C/C++

Preferred skills

publications in top-tier conferences (CVPR/ICCV/ECCV/NeurIPS/SIGGRAPH), top rankings in visual/algorithm competitions, core contributions to high-impact open-source projects

Responsibilities

Design and implement multimodal large models for specific verticals, optimize training stability and efficiency, integrate models into business scenarios

Seniority

Senior, hands-on IC

Sourced via tencent · Listed on CareerPlan, which tracks 854,000+ jobs from 20+ sources.