ALIBABATEXT-TO-SPEECH51,380 SAMPLES / 30 DAYSLAST RUN AUG 28, 2026, 21:30 UTC

official resource

Qwen3 TTS Flash Realtime text-to-speech benchmarks

Qwen3 TTS Flash Realtime is Alibaba Cloud's streaming synthesis endpoint in the Qwen family.

Time to First Audio#28 / 30
645ms
TTFA Network Roundtrip#26 / 28
553ms
TTFA Leading Silence#15 / 28
96ms
Word Error Rate#30 / 30
8.8%

Overview

Alibaba serves the multilingual proprietary endpoint through Model Studio from an Asia-region deployment.

Qwen3 TTS Flash Realtime is tested every day on a fixed set of text prompts, measuring how quickly audible speech starts and how intelligible the result is.

Technical specifications

Made by
Alibaba
Hosted by
Alibaba
Source
Official API
Licensing
Proprietary
Deployment
Cloud
Region
Asia
Features
Multilingual

How Qwen3 TTS Flash Realtime ranks

Full TTS dashboard
Time to First Audio — every measured TTS modelMilliseconds · lower is better · 30-day averageEvery TTS model ranked on Time to First Audio, with Qwen3 TTS Flash Realtime highlighted.
  1. #2vui124 ms
  2. #3TTS Flash 2128 ms
  3. #4TTS 2176 ms
  4. #5Blizzard235 ms
  5. #6Neural236 ms
  6. #7Mist v3256 ms
  7. #8TTS Rt v2262 ms
  8. #9Sonic 3.5274 ms
  9. #10TTS RT v1275 ms
  10. #12Coda313 ms
  11. #13Aura 2328 ms
  12. #14S2.1 Pro374 ms
  13. #15Default384 ms
  14. #18Grok TTS420 ms
  15. #19S1434 ms
  16. #20Flash v2.5455 ms
  17. #21Speech 2.8 HD460 ms
  18. #22Sonic 3.6466 ms
  19. #23Simba 3.2484 ms
  20. #24Chirp 3 HD512 ms
  21. #25Simba 3.0526 ms
  22. #26Falcon 2549 ms
Show all 30 models
  1. #29S2.1 Pro Free806 ms
  2. #30GPT-4o mini TTS1075 ms
median of all models · 397 ms
TTS models over the last 30 days, ranked on Time to First Audio.
#ModelHostTTFAWERSamples
1Palabra TTS v1Palabra116 ms5.9%14,396
2vuiFluxions124 ms8,624
3TTS Flash 2Inworld AI128 ms8,719
4TTS 2Inworld AI176 ms4.8%14,529
5BlizzardLmnt235 ms7.4%14,117
6NeuralAzure236 ms4.3%3,350
7Mist v3Rime256 ms6.3%14,524
8TTS Rt v2Soniox262 ms8,849
9Sonic 3.5Cartesia274 ms6.1%14,513
10TTS RT v1Soniox275 ms3.7%14,528
11Dragon HD LatestAzure310 ms5.1%3,350
12CodaRime313 ms5.2%14,523
13Aura 2Deepgram328 ms5.3%14,501
14S2.1 ProFish Audio374 ms10,222
15DefaultGradium384 ms4.6%14,002
16Speech 2.8 TurboMiniMax411 ms4.8%1,997
17Eleven v3 ConversationalElevenLabs412 ms6,750
18Grok TTSxAI420 ms4.7%14,524
19S1Fish Audio434 ms4.9%10,236
20Flash v2.5ElevenLabs455 ms6.7%9,259
21Speech 2.8 HDMiniMax460 ms1,995
22Sonic 3.6Cartesia466 ms560
23Simba 3.2Speechify484 ms4.7%14,525
24Chirp 3 HDGoogle512 ms5.2%14,530
25Simba 3.0Speechify526 ms5.3%14,526
26Falcon 2Murf549 ms10,229
27Lightning v3.1 ProSmallest586 ms4.4%14,515
28Qwen3 TTS Flash RealtimeAlibaba645 ms8.8%14,530
29S2.1 Pro FreeFish Audio806 ms4.7%14,464
30GPT-4o mini TTSOpenAI1075 ms4.8%14,517
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Latency vs accuracy

Averages and tail latency

Averages hide slow outliers — these are the distributions behind each figure.

Qwen3 TTS Flash Realtime latency distributionMilliseconds · shared axis across metrics · last 30 daysQwen3 TTS Flash Realtime's latency percentiles per metric: p25–p75 band, p50 tick, whisker to p99.
  • Time to First Audiop50 697 ms · p99 987 ms
  • TTFA Network Roundtripp50 607 ms · p99 921 ms
  • TTFA Leading Silencep50 91 ms · p99 182 ms
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops
Average and percentile values per metric, with the number of samples behind each row.
MetricAveragep25p50p75p90p95p99Samples
Time to First Audio645 ms513 ms697 ms737 ms767 ms790 ms987 ms14,530
TTFA Network Roundtrip553 ms420 ms607 ms646 ms674 ms694 ms921 ms11,160
TTFA Leading Silence96 ms87 ms91 ms96 ms105 ms125 ms182 ms11,160
Word Error Rate8.8%0.0%5.6%12.5%24.0%31.6%48.0%14,530

Last 30 days

Daily medians from the same measurement runs · gaps are days without qualifying runs.

Time to First Audio — daily p50Line p50 · band p25–p75 · UTC daysQwen3 TTS Flash Realtime's daily median Time to First Audio over the last 30 days.
Qwen3 TTS Flash Realtime · Jul 30: 620 msQwen3 TTS Flash Realtime · Jul 31: 544 msQwen3 TTS Flash Realtime · Aug 1: 629 msQwen3 TTS Flash Realtime · Aug 2: 723 msQwen3 TTS Flash Realtime · Aug 3: 613 msQwen3 TTS Flash Realtime · Aug 4: 625 msQwen3 TTS Flash Realtime · Aug 5: 625 msQwen3 TTS Flash Realtime · Aug 6: 623 msQwen3 TTS Flash Realtime · Aug 7: 720 msQwen3 TTS Flash Realtime · Aug 8: 537 msQwen3 TTS Flash Realtime · Aug 9: 733 msQwen3 TTS Flash Realtime · Aug 10: 654 msQwen3 TTS Flash Realtime · Aug 11: 675 msQwen3 TTS Flash Realtime · Aug 12: 724 msQwen3 TTS Flash Realtime · Aug 13: 540 msQwen3 TTS Flash Realtime · Aug 14: 633 msQwen3 TTS Flash Realtime · Aug 15: 614 msQwen3 TTS Flash Realtime · Aug 16: 520 msQwen3 TTS Flash Realtime · Aug 17: 716 msQwen3 TTS Flash Realtime · Aug 18: 628 msQwen3 TTS Flash Realtime · Aug 19: 652 msQwen3 TTS Flash Realtime · Aug 20: 710 msQwen3 TTS Flash Realtime · Aug 21: 552 msQwen3 TTS Flash Realtime · Aug 22: 732 msQwen3 TTS Flash Realtime · Aug 23: 549 msQwen3 TTS Flash Realtime · Aug 24: 729 msQwen3 TTS Flash Realtime · Aug 25: 640 msQwen3 TTS Flash Realtime · Aug 26: 740 msQwen3 TTS Flash Realtime · Aug 27: 572 msQwen3 TTS Flash Realtime · Aug 28: 724 ms
Word Error Rate — daily averageDaily average · UTC daysQwen3 TTS Flash Realtime's daily Word Error Rate over the last 30 days.
Qwen3 TTS Flash Realtime · Jul 30: 12.8%Qwen3 TTS Flash Realtime · Jul 31: 7.5%Qwen3 TTS Flash Realtime · Aug 1: 9.8%Qwen3 TTS Flash Realtime · Aug 2: 7.4%Qwen3 TTS Flash Realtime · Aug 3: 9.8%Qwen3 TTS Flash Realtime · Aug 4: 11.5%Qwen3 TTS Flash Realtime · Aug 5: 10.2%Qwen3 TTS Flash Realtime · Aug 6: 7.7%Qwen3 TTS Flash Realtime · Aug 7: 9.2%Qwen3 TTS Flash Realtime · Aug 8: 7.7%Qwen3 TTS Flash Realtime · Aug 9: 10.0%Qwen3 TTS Flash Realtime · Aug 10: 9.9%Qwen3 TTS Flash Realtime · Aug 11: 8.5%Qwen3 TTS Flash Realtime · Aug 12: 10.9%Qwen3 TTS Flash Realtime · Aug 13: 8.3%Qwen3 TTS Flash Realtime · Aug 14: 11.9%Qwen3 TTS Flash Realtime · Aug 15: 7.5%Qwen3 TTS Flash Realtime · Aug 16: 8.7%Qwen3 TTS Flash Realtime · Aug 17: 11.5%Qwen3 TTS Flash Realtime · Aug 18: 9.4%Qwen3 TTS Flash Realtime · Aug 19: 10.0%Qwen3 TTS Flash Realtime · Aug 20: 9.8%Qwen3 TTS Flash Realtime · Aug 21: 10.6%Qwen3 TTS Flash Realtime · Aug 22: 9.2%Qwen3 TTS Flash Realtime · Aug 23: 8.7%Qwen3 TTS Flash Realtime · Aug 24: 10.5%Qwen3 TTS Flash Realtime · Aug 25: 8.7%Qwen3 TTS Flash Realtime · Aug 26: 10.9%Qwen3 TTS Flash Realtime · Aug 27: 10.2%Qwen3 TTS Flash Realtime · Aug 28: 8.4%

Time to First Audio by dataset

Qwen3 TTS Flash Realtime by test conditionMilliseconds · lower is better · best condition firstQwen3 TTS Flash Realtime's Time to First Audio on each benchmark dataset.
Time to First Audio per dataset, with the number of samples behind each figure.
DatasetTTFASamples
Text prompts645 ms14,530

Strongest condition: Text prompts at 645 ms · weakest: Text prompts at 645 ms.

Limits of this comparison

The full identifier distinguishes this real-time configuration from other Qwen audio models.

  • Serving region contributes to roundtrip from Coval's US worker, so latency may differ for callers colocated in Asia. Coval separates network roundtrip from leading silence when those measurements are available.

Official sources

Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo