Data Engineer, Analytics Data Products
Core
Building foundational data pipelines and reusable data products in a hybrid cloud environment to power analytics across The New York Times company.
Role type
Data Engineer (Analytics Data Products)
Builds
Core, reusable data products and pipelines for company-wide analytics
Domain
Media / Journalism / Data Engineering
Deliverable
production ML models | product features
Required skills
Python, SQL, data modeling (dimensional/Kimball/OBT/Data Vault), end-to-end pipeline ownership, Cloud Data Warehouses (BigQuery/Snowflake/Databricks), workflow orchestration (Airflow/Cloud Composer/Prefect), Git
Preferred skills
Dual-cloud environment (GCP/AWS), Infrastructure-as-Code (Terraform), PySpark, Lakehouse formats (Iceberg/Delta Lake), CI/CD integration for data quality
Technologies
AWS (S3, Glue, Athena, EMR), GCP (GCS, BigQuery, Cloud Composer, Dataproc), dbt, Parquet, Iceberg, Spark
Responsibilities
Design and implement complex data pipelines in medallion architecture; Develop advanced data transformations using dbt and PySpark; Manage physical data storage and optimize file formats/partitioning; Tune Spark compute resources; Optimize user queries and access patterns; Implement centralized data quality checks and observability; Contribute to metadata management, data lineage, and RBAC programs
Seniority
Mid-level, hands-on IC