Alibabas Tongyi-Labor hat veröffentlicht Qwen-Audio-3.0-TTSein produktionsorientiertes Textual content-to-Speech-System (TTS). Das Modell wird in zwei Varianten aus derselben Linie geliefert. Blitz zielt auf Echtzeitinteraktion ab. Plus zielt auf eine qualitativ hochwertige Erzeugung ab. Beide werden als gehostete Modelle bereitgestellt Alibaba Cloud Mannequin Studionicht als herunterladbare Gewichte.
Die Veröffentlichung konzentriert sich auf vier Dinge, auf die Entwickler in der Produktion stoßen: breitere Sprachabdeckung, Kontrolle des Stils natürlicher Sprache, feinkörnige Tag-Kontrolle und Robustheit, wenn das Referenzaudio nicht sauber ist. Qwen-Audio-3.0-TTS-Plus belegt auch bei den unabhängigen Anbietern den ersten Platz Künstliche Analyse Textual content-to-Speech-Bestenliste.
Zwei Varianten, eine Abstammung
Die beiden Ebenen sind unterschiedlichen Jobs zugeordnet. Blitz ist auf Echtzeitinteraktion abgestimmt, wobei die Latenz des ersten Pakets bei 300 ms liegt. Plus ist auf eine hochwertige Erzeugung abgestimmt, bei der Natürlichkeit und Klangtreue wichtiger sind als Geschwindigkeit.
Die Modell-IDs sind qwen-audio-3.0-tts-flash Und qwen-audio-3.0-tts-plus. Beide werden über ein bidirektionales WebSocket-Streaming-Protokoll aufgerufen. Die API unterstützt PCM, WAV, MP3 und Opus mit einer Abtastrate von bis zu 48 kHz. Es stellt Streaming-Ein- und -Ausgabe, Sprachklonen und Sprachdesignund Befehlskontrolle. Alibaba stellt das DashScope SDK sowie rohe WebSocket-Beispiele in Python, Java, Go, C#, PHP und Node.js in seinen Regionen Singapur und Peking bereit.
Wie das Modell aufgebaut ist
Zwei Designoptionen verankern das System.
- A 12,5-Hz-Sprach-Tokenizer mit niedriger Bildrate Reduziert die Kosten für die autoregressive Dekodierung und behält gleichzeitig Inhalts- und Sprecherinformationen bei. Eine niedrigere Bildrate bedeutet weniger Audio-Tokens professional Sekunde, was die Inferenzlatenz verringert.
- A fünfstufiges progressives Trainingsparadigma koordiniert die Komponenten Sprachmodell (LM) und Stream-Matching (FM). Die Phasen sind unabhängiges LM- und FM-Vortraining, gemeinsames Coaching mit hochwertigem Datenglühen, LM-Verstärkungslernen, FM-Robustheitstraining und FM-Verstärkungslernen. Das Forschungsteam berichtet, dass diese Pipeline die Inhaltskonsistenz, prosodische Natürlichkeit, Stimmtreue, Wahrnehmungsqualität und Robustheit verbessert.
Das Modell beherrscht auch Langformsynthesen in einem Durchgang von bis zu 3 Minuten, harte Textnormalisierungsfälle und Vocoder-Superauflösung für die 48-kHz-Ausgabe.
