AI与大数据存储研发工程师-基础设施
Core
Design and deliver end-to-end storage solutions for large model training and inference, optimizing for high concurrency, low latency, and stability in recommendation, advertising, and search scenarios.
Role type
Senior IC distributed storage engineer (AI infrastructure)
Builds
High-availability, scalable, and cost-effective storage clusters supporting EB-scale data for AI training and big data workloads.
Domain
AI infrastructure + Distributed Storage Systems
Deliverable
production ML models
Required skills
Distributed storage system principles, Java/C/C++/Go, high-concurrency network programming, AI storage architecture (3FS, Tectonic, Colossus), big data component internals (Yarn, Spark, Flink, Kafka, HBase, ClickHouse)
Preferred skills
PB/EB-scale cluster optimization, open-source contributions (HDFS, Ceph, Alluxio), AI training data governance
Technologies
Java, C, C++, Go, Kafka, ClickHouse, HBase, Spark, Flink, Yarn, HDFS, Ceph, Alluxio, 3FS, Tectonic, Colossus
Responsibilities
Architect storage solutions for large model training/inference, optimize storage strategies for specific AI scenarios, adapt and upgrade storage layers for big data components, resolve IO blocking and data scheduling bottlenecks.
Seniority
Senior, hands-on IC