ALIBABATEXT-TO-SPEECH51,380 SAMPLES / 30 DAYSLAST RUN AUG 28, 2026, 21:30 UTC
Qwen3 TTS Flash Realtime text-to-speech benchmarks
Qwen3 TTS Flash Realtime is Alibaba Cloud's streaming synthesis endpoint in the Qwen family.
- Time to First Audio#28 / 30
- 645ms
- TTFA Network Roundtrip#26 / 28
- 553ms
- TTFA Leading Silence#15 / 28
- 96ms
- Word Error Rate#30 / 30
- 8.8%
Overview
Alibaba serves the multilingual proprietary endpoint through Model Studio from an Asia-region deployment.
Qwen3 TTS Flash Realtime is tested every day on a fixed set of text prompts, measuring how quickly audible speech starts and how intelligible the result is.
How Qwen3 TTS Flash Realtime ranks
Full TTS dashboard- #15Default384 ms
Show all 30 modelsShow fewer
- #6Default4.6%
| # | Model | Host | TTFA | WER | Samples |
|---|---|---|---|---|---|
| 1 | Palabra TTS v1 | Palabra | 116 ms | 5.9% | 14,396 |
| 2 | vui | Fluxions | 124 ms | 8,624 | |
| 3 | TTS Flash 2 | Inworld AI | 128 ms | 8,719 | |
| 4 | TTS 2 | Inworld AI | 176 ms | 4.8% | 14,529 |
| 5 | Blizzard | Lmnt | 235 ms | 7.4% | 14,117 |
| 6 | Neural | Azure | 236 ms | 4.3% | 3,350 |
| 7 | Mist v3 | Rime | 256 ms | 6.3% | 14,524 |
| 8 | TTS Rt v2 | Soniox | 262 ms | 8,849 | |
| 9 | Sonic 3.5 | Cartesia | 274 ms | 6.1% | 14,513 |
| 10 | TTS RT v1 | Soniox | 275 ms | 3.7% | 14,528 |
| 11 | Dragon HD Latest | Azure | 310 ms | 5.1% | 3,350 |
| 12 | Coda | Rime | 313 ms | 5.2% | 14,523 |
| 13 | Aura 2 | Deepgram | 328 ms | 5.3% | 14,501 |
| 14 | S2.1 Pro | Fish Audio | 374 ms | 10,222 | |
| 15 | Default | Gradium | 384 ms | 4.6% | 14,002 |
| 16 | Speech 2.8 Turbo | MiniMax | 411 ms | 4.8% | 1,997 |
| 17 | Eleven v3 Conversational | ElevenLabs | 412 ms | 6,750 | |
| 18 | Grok TTS | xAI | 420 ms | 4.7% | 14,524 |
| 19 | S1 | Fish Audio | 434 ms | 4.9% | 10,236 |
| 20 | Flash v2.5 | ElevenLabs | 455 ms | 6.7% | 9,259 |
| 21 | Speech 2.8 HD | MiniMax | 460 ms | 1,995 | |
| 22 | Sonic 3.6 | Cartesia | 466 ms | 560 | |
| 23 | Simba 3.2 | Speechify | 484 ms | 4.7% | 14,525 |
| 24 | Chirp 3 HD | 512 ms | 5.2% | 14,530 | |
| 25 | Simba 3.0 | Speechify | 526 ms | 5.3% | 14,526 |
| 26 | Falcon 2 | Murf | 549 ms | 10,229 | |
| 27 | Lightning v3.1 Pro | Smallest | 586 ms | 4.4% | 14,515 |
| 28 | Qwen3 TTS Flash Realtime | Alibaba | 645 ms | 8.8% | 14,530 |
| 29 | S2.1 Pro Free | Fish Audio | 806 ms | 4.7% | 14,464 |
| 30 | GPT-4o mini TTS | OpenAI | 1075 ms | 4.8% | 14,517 |
Latency vs accuracy
Averages and tail latency
Averages hide slow outliers — these are the distributions behind each figure.
- Time to First Audiop50 697 ms · p99 987 ms
- TTFA Network Roundtripp50 607 ms · p99 921 ms
- TTFA Leading Silencep50 91 ms · p99 182 ms
- Qwen3 TTS Flash Realtimep50 5.6% · p99 48.0%
| Metric | Average | p25 | p50 | p75 | p90 | p95 | p99 | Samples |
|---|---|---|---|---|---|---|---|---|
| Time to First Audio | 645 ms | 513 ms | 697 ms | 737 ms | 767 ms | 790 ms | 987 ms | 14,530 |
| TTFA Network Roundtrip | 553 ms | 420 ms | 607 ms | 646 ms | 674 ms | 694 ms | 921 ms | 11,160 |
| TTFA Leading Silence | 96 ms | 87 ms | 91 ms | 96 ms | 105 ms | 125 ms | 182 ms | 11,160 |
| Word Error Rate | 8.8% | 0.0% | 5.6% | 12.5% | 24.0% | 31.6% | 48.0% | 14,530 |
Last 30 days
Daily medians from the same measurement runs · gaps are days without qualifying runs.
Time to First Audio by dataset
- Text prompts645 ms
| Dataset | TTFA | Samples |
|---|---|---|
| Text prompts | 645 ms | 14,530 |
Strongest condition: Text prompts at 645 ms · weakest: Text prompts at 645 ms.
Limits of this comparison
The full identifier distinguishes this real-time configuration from other Qwen audio models.
- Serving region contributes to roundtrip from Coval's US worker, so latency may differ for callers colocated in Asia. Coval separates network roundtrip from leading silence when those measurements are available.
Official sources
- Alibaba Cloud Qwen TTS Realtime (documentation)
Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.
Evaluate your own voice agent
Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.