AWS опубликовала инструкцию по развёртыванию модели Qwen3-TTS-12Hz-1.7B-Base через SageMaker JumpStart. Это эндпоинт для инференса в реальном времени. Модель открытая, разработана командой Qwen в Alibaba Cloud. Работает с речевым токенайзером Qwen3-TTS-Tokenizer-12Hz. Поддерживает 10 языков: китайский, английский, японский, корейский, немецкий, французский, русский, португальский, испанский и итальянский.
Вариант Base клонирует голос по короткому референсному аудио и его транскрипту. Дообучение не требуется — хватает нескольких секунд образца. Модель ловит тембр, высоту и манеру речи и применяет их к новому тексту, в том числе на другом языке. В посте также доступен вариант CustomVoice с фиксированным набором голосов и модель распознавания речи Qwen3-ASR-1.7B.
Развёртывание идёт через JumpStartModel: model_id huggingface-ttsvoiceclone-qwen3-tts-12hz-1-7b-base, версия 1.0.1. В посте используется инстанс ml.g6.4xlarge с одним NVIDIA L4 на 24 ГБ. Модель обслуживается vLLM-Omni контейнером в две стадии. Стадия talker генерирует речевые токены, стадия code2wav превращает их в WAV 24 кГц. Обе стадии делят одну GPU, поэтому важно правильно выставить SM_VLLM_GPU_MEMORY_UTILIZATION. Со значением 0.45 на каждую стадию две резервации в сумме дают 0,9 и оставляют около 10% запаса. В этом режиме кэш KV рассчитан на 56 928 токенов. Этого хватает на несколько параллельных коротких запросов.
Qwen3-TTS поддерживает потоковую генерацию и выдаёт звук с низкой задержкой. Это подходит для разговорных сценариев. Оплата идёт за инстанс, а не за символы текста. Аудио не выходит за пределы вашего аккаунта AWS.
Место в агентском стеке
Qwen3-TTS закрывает только синтез речи. Это не LLM и не модель для рассуждений. В связке с агентом модель занимает узкую роль: озвучивание ответа в голосовом интерфейсе. Распознавание речи в семействе решает отдельная модель — Qwen3-ASR-1.7B. Для текстовых конвейеров, планирования и оркестрации Qwen3-TTS не подходит.
Что проверить у себя
- Поддерживает ли JumpStart нужный вам инстанс и хватает ли квоты под ml.g6.4xlarge.
- Укладываются ли ваши средние запросы в бюджет кэша KV. Его пишут в лог /aws/sagemaker/Endpoints/
при старте контейнера. - Совпадает ли с вашим языком один из 10 поддерживаемых, если планируете кросс-языковое клонирование.
- Где у вас сейчас идёт синтез речи и есть ли смысл переносить его на свой эндпоинт ради контроля над аудио и расходами.