Software Engineer: Applied NLP/ML and Data Systems (Mid-career / Senior)
Core
Build and maintain data pipelines that ingest NLP and financial data from global public equities to produce industry classification and thematic factor risk models for institutional investors.
Role type
Senior IC data engineering and applied ML engineer
Builds
Industry classification datasets and thematic factor risk model datasets
Domain
Financial services / NLP / Data Engineering
Deliverable
production ML models | product features
Required skills
Python, pandas, Parquet/Arrow, DuckDB/Snowflake, batch pipeline orchestration (Dagster/Airflow), applied ML (embeddings, clustering, inference), AWS, CI/CD
Preferred skills
LLM engineering (prompting, batch inference), SageMaker/Bedrock, financial domain knowledge (taxonomies, factor models), Infrastructure as Code (CDK/Terraform), Docker
Technologies
Python, pandas, Parquet, Arrow, DuckDB, Snowflake, Dagster, Airflow, S3, AWS, SageMaker, Bedrock, Terraform, Docker
Responsibilities
Build pipelines to classify global public equities across a five-level taxonomy using filings and web content; Run large-scale NLP and LLM inference for entity extraction and knowledge graph construction; Ingest market data and publish datasets to external distributors; Own schema and contract evolution for datasets with downstream consumers; Collaborate with economists to turn modeling decisions into reliable production data.