CareerPlanSign in

豆包语音合成大模型算法工程师 - Data语音

杭州💼 Full-time🗓 2026-09-28

Core

Developing next-generation large-scale audio generation models for text-to-speech (TTS), voice cloning, and cross-lingual synthesis to power content creation and voice interaction products.

Role type

Senior IC machine-learning engineer (audio generation)

Builds

Production-ready TTS and audio generation models deployed in products like DouBao, TikTok, CapCut, and via Volcengine platforms.

Domain

AI / Audio / Large Language Models

Deliverable

production ML models

Required skills

TTS algorithms, large-scale audio generation, diffusion models, audio codecs, PyTorch, C++, CUDA, model quantization, inference optimization

Preferred skills

Voice cloning, cross-lingual synthesis, model lightweighting, research publications in top conferences

Responsibilities

Research and develop core TTS and audio generation technologies; optimize model quality, naturalness, and emotional expressiveness; deploy models in complex business scenarios; explore Model-as-a-service applications.

Seniority

Senior, hands-on IC

Sourced via bytedance · Listed on CareerPlan, which tracks 844,000+ jobs from 20+ sources.