微信-多模态大模型算法工程师-OCR与文档理解方向(北京)
Core
Develop and deploy multimodal large models for OCR and document understanding to support WeChat's C-end applications, search, recommendation, and review systems across Video Accounts, Official Accounts, and WeChat Stores.
Role type
Senior IC multimodal large model algorithm engineer (OCR & document understanding)
Builds
Multimodal large models for search, recommendation, and content review
Domain
Consumer internet + computer vision + document intelligence
Deliverable
production ML models
Required skills
multimodal large model architecture design, large-scale data construction/cleaning/governance, distributed model training, pretraining, supervised fine-tuning (SFT), alignment (RLHF/DPO), OCR, table recognition, layout analysis, key information extraction (KIE), Python, C/C++
Preferred skills
publications in top-tier conferences (CVPR/ICCV/ECCV/NeurIPS/SIGGRAPH), top rankings in visual/algorithm competitions, core contributions to high-impact open-source projects
Responsibilities
Design and implement multimodal large models for specific verticals, optimize training stability and efficiency, integrate models into business scenarios
Seniority
Senior, hands-on IC