Tag
The paper proposes Kraken, an LLM-based speech-to-speech translation model using low-bitrate vector quantization and dual-path source conditioning to enhance translation quality and preserve speaker prosody, built on Qwen3-8B.
Amphion is an open-source toolkit for audio, music, and speech generation, providing model visualizations, vocoders, and evaluation metrics to support reproducible research.