Qwen-Audio-3.0-TTS: Alibaba обошла ElevenLabs и стала первой в мире по качеству голоса
Alibaba только что выложила TTS-модель (текст в речь), которая заняла первое место в независимом рейтинге Artificial Analysis Speech Arena. Обошла ElevenLabs, Gemini, Sonic. И стоит в три раза дешевле конкурентов.
20 июля команда Tongyi Lab (подразделение Alibaba Cloud, стоящее за Qwen) выпустила Qwen-Audio-3.0-TTS — систему преобразования текста в речь. Две версии: Flash для реального времени и Plus для высокого качества. Обе доступны через API (программный интерфейс).
Что нового
Qwen-Audio-3.0-TTS умеет то, что раньше требовало нескольких отдельных инструментов:
Теги для управления интонацией. В текст можно вставлять специальные теги: [whisper] для шёпота, [angry] для злости, [breaths] для пауз с дыханием, [laughs] для смеха. Всего 86 тегов. Модель читает их и передаёт нужную эмоцию в голосе.
Управление на естественном языке. Вместо сложных настроек можно написать: «прочитай это медленно, как сказку на ночь» — и модель сделает именно так. Или: «говори как взволнованный спортивный комментатор» — и тон изменится. Никаких параметров, просто текстовая инструкция.
16 языков и 20 китайских диалектов. Английский, китайский, японский, корейский, французский, немецкий, испанский, португальский и другие. Плюс 20 региональных диалектов Китая — от кантонского до сычуаньского.
Работа с шумным аудио. Если референсное аудио (образец голоса для клонирования) записано с шумом, реверберацией или нечётко — модель всё равно выдаёт чистый результат. Для продакшена это критично: не всегда можно записать идеальный образец.
Длинный текст за один проход. До 3 минут непрерывного аудио без разбивки на куски. Для подкастов, аудиокниг, дубляжа — удобно.
Две версии: Flash и Plus
Flash — для реального времени. Задержка первого пакета — 300 миллисекунд. Подходит для голосовых ассистентов, чат-ботов, интерактивных диалогов. Когда пользователь ждёт ответ — 300 мс это почти мгновенно.
Plus — для качества. Занимает первое место в Artificial Analysis Speech Arena (независимый рейтинг) с результатом 1238 Elo. Обошла Simba 3.2, Gemini 3.1 Flash TTS и Sonic 3.5. Для дубляжа, озвучки, подкастов — максимальное качество.
Цена: в три раза дешевле ElevenLabs
Qwen-Audio-3.0-TTS стоит $27.59 за миллион символов через API. Для сравнения: ElevenLabs и MiniMax берут примерно в три раза больше за аналогичный объём.
Это не демпинг, а структурное преимущество: Alibaba владеет собственной инфраструктурой (облачные вычисления Alibaba Cloud), поэтому может позволить себе более низкие маржи.
Сравнение с конкурентами
На Artificial Analysis Speech Arena (независимый бенчмарк, где модели сравниваются по человеческим предпочтениям) Qwen-Audio-3.0-TTS-Plus занял первое место с Elo 1238.
Для контекста: Artificial Analysis — это платформа, где люди слушают два анонимных аудиофрагмента и выбирают, какой звучит лучше. Никаких автоматических метрик — только живые уши.
Победившие модели в порядке рейтинга: Qwen-Audio-3.0-TTS-Plus, Simba 3.2, Gemini 3.1 Flash TTS, Sonic 3.5, ElevenLabs v3.
Как использовать
Модель доступна через Alibaba Cloud Model Studio API (облачный программный интерфейс). Нужен аккаунт Alibaba Cloud, после чего можно вызывать API напрямую. Также есть версия с открытым исходным кодом на GitHub (QwenLM/Qwen3-TTS) — но это отдельная линейка с базовыми возможностями, не полная Plus-версия.
Почему это важно
TTS (Text-to-Speech, текст в речь) — это одна из тех технологий, которые становятся настолько хорошими, что перестают быть заметными. Когда голос звучит естественно, вы не задумываетесь, что его сгенерировала нейросеть. Вы просто слушаете.
Qwen-Audio-3.0-TTS делает ещё один шаг: не просто естественный голос, а управляемый. Шёпот, смех, дыхание, эмоции — всё через простые теги в тексте. Для подкастеров, дубляжёров, разработчиков голосовых ассистентов — это новая планка.
И отдельно: Alibaba, китайская компания, обошла западных конкурентов в TTS-сегменте. После Kimi K3 и DeepSeek V4 — это ещё один сигнал, что AI-гонка больше не односторонняя.
Комментарии ()