CareerPlanSign in

混元大语言数据工程师(北京/深圳)

Shenzhen, China💼 Full-time🗓 2026-09-28

Core

Full-stack engineering implementation for document data processing pipelines to support large model pre-training and multimodal understanding.

Role type

Senior IC data engineer (large language models)

Builds

Document data processing pipelines for large model pre-training

Domain

AI/ML, Large Language Models, Document Processing

Deliverable

production ML models

Required skills

Deep learning frameworks (PyTorch, TensorFlow), Big data technologies (Spark, Hadoop, Ray), File storage systems, Data engineering architecture design, Agent-based data production, Multimodal data processing

Preferred skills

Document parsing experience, Large model pre-training data processing, Agent-based data production chain development, Multimodal understanding data processing

Responsibilities

Implement full-link engineering for document data processing including storage, computation, parsing, deduplication, and quality filtering; Handle billion-scale data processing; Develop and optimize data production pipelines based on Agents.

Sourced via tencent · Listed on CareerPlan, which tracks 844,000+ jobs from 20+ sources.