智能湖仓研发工程师(上海/深圳)
Core
Build high-performance, governable, and reusable data infrastructure for a unified AI data lake, supporting storage, metadata, indexing, versioning, permissions, lifecycle, and query planning.
Role type
Senior IC data infrastructure engineer (AI data lake & lakehouse)
Builds
Unified data assets (samples, features, behavior logs, model I/O) and efficient access capabilities for ad, recommendation, and search business scenarios.
Domain
AI data platforms, distributed systems, storage systems, lakehouse, and retrieval systems
Deliverable
production ML models
Required skills
Distributed system design, storage system architecture, data lake/lakehouse mechanisms, query planning, columnar storage optimization, end-to-end performance tuning
Preferred skills
Ad/recommendation/search data pipelines, vector retrieval, multi-modal data management, RAG, large-scale embedding governance
Technologies
Spark, Flink, StarRocks, Ray, PyTorch, Trino, Presto, Hive, Parquet, Lance, Vortex, Nimble, Arrow, Iceberg, Hudi, Paimon
Responsibilities
Optimize data writing, scanning, filtering, sampling, batch reading, training data loading, and result writing for big data and AI frameworks.
Seniority
Senior, hands-on IC