Data Scientist & Engineer
Core
Building foundational data capabilities and AI-enabled products for legal services using Microsoft Fabric and Databricks.
Role type
Senior IC hybrid data-engineering and applied-data scientist
Builds
Trusted, reusable data assets, reliable pipelines, lakehouse models, and analytical products for client intelligence and firm decision support
Domain
Legal services / Enterprise Data Engineering / Applied Machine Learning
Deliverable
production ML models | product features | dashboards & analysis
Required skills
Python, SQL, PySpark, Microsoft Fabric, Databricks, NLP, embeddings, LLM-assisted techniques, statistical modeling, data lineage, Git, CI/CD
Preferred skills
Azure Data Lake, dbt, Airflow, MLflow, vector databases, MLOps, causal inference
Technologies
Microsoft Fabric, Databricks, Python, SQL, PySpark, Git, Azure Data Lake, dbt, Airflow, MLflow
Responsibilities
Design and operate scalable data pipelines for ingestion, cleaning, and standardization of structured and unstructured data; Create scalable lakehouse data models and reusable features for legal entities; Implement data-quality checks, lineage, and monitoring within workflows; Develop and validate statistical and machine-learning models for classification, ranking, and forecasting; Use NLP and embeddings for entity resolution and information extraction in document-heavy data; Publish curated datasets and analytical outputs via APIs and data products.
Seniority
Senior, hands-on IC