Principal Data Scientist
Core
Building production NLP pipelines to extract entities, classifications, claims, and summaries from millions of scientific journal articles for downstream agentic applications.
Role type
Principal Data Scientist (NLP & Agentic AI)
Builds
Production NLP pipelines, evaluation frameworks, and agentic AI reasoning systems
Domain
Scientific publishing, NLP, Agentic AI
Deliverable
production ML models
Required skills
Python (asyncio, threads, queues), NLP (NER, classification, sequence labeling), LLMs (prompting, fine-tuning, embeddings), retrieval, evaluation design, pipeline orchestration
Preferred skills
Scientific text domain expertise, AWS (S3, Batch, Lambda, SageMaker), data lake patterns (Parquet, Iceberg), agentic AI (tool use, multi-step reasoning)
Technologies
Python, Airflow, Dagster, AWS, Parquet, Iceberg, LLMs
Responsibilities
Design and build NLP enrichment pipelines at scale; compare traditional NLP vs LLM approaches and select optimal tools; own evaluation strategy and golden set creation; write production-quality Python code; collaborate with data engineers on pipeline orchestration; contribute to agentic AI application development
Seniority
Principal, hands-on IC with mentorship
