豆包语音合成大模型算法工程师 - Data语音
Core
Developing next-generation large-scale audio generation models for text-to-speech (TTS), voice cloning, and cross-lingual synthesis to power content creation and voice interaction products.
Role type
Senior IC machine-learning engineer (audio generation)
Builds
Production-ready TTS and audio generation models deployed in products like DouBao, TikTok, CapCut, and via Volcengine platforms.
Domain
AI / Audio / Large Language Models
Deliverable
production ML models
Required skills
TTS algorithms, large-scale audio generation, diffusion models, audio codecs, PyTorch, C++, CUDA, model quantization, inference optimization
Preferred skills
Voice cloning, cross-lingual synthesis, model lightweighting, research publications in top conferences
Responsibilities
Research and develop core TTS and audio generation technologies; optimize model quality, naturalness, and emotional expressiveness; deploy models in complex business scenarios; explore Model-as-a-service applications.
Seniority
Senior, hands-on IC