混元大语言数据工程师(北京/深圳)
Core
Full-stack engineering implementation for document data processing pipelines to support large model pre-training and multimodal understanding.
Role type
Senior IC data engineer (large language models)
Builds
Document data processing pipelines for large model pre-training
Domain
AI/ML, Large Language Models, Document Processing
Deliverable
production ML models
Required skills
Deep learning frameworks (PyTorch, TensorFlow), Big data technologies (Spark, Hadoop, Ray), File storage systems, Data engineering architecture design, Agent-based data production, Multimodal data processing
Preferred skills
Document parsing experience, Large model pre-training data processing, Agent-based data production chain development, Multimodal understanding data processing
Responsibilities
Implement full-link engineering for document data processing including storage, computation, parsing, deduplication, and quality filtering; Handle billion-scale data processing; Develop and optimize data production pipelines based on Agents.