ALIBABA CLOUDTEXT-TO-SPEECH44,884 SAMPLES / 30 DAYSLAST RUN SEP 15, 2026, 07:00 UTC

official resource

Qwen3 TTS Flash Realtime text-to-speech benchmarks

Qwen3 TTS Flash Realtime, hosted by Alibaba Cloud, measures mean 754 ms time to first audio (26th of 28) and 8.9% word error rate (28th of 28) among TTS systems. Results cover the last 30 days. Coval benchmarks hosted endpoints daily using a consistent evaluation methodology. Last measured .

Qwen3 TTS Flash Realtime is Alibaba Cloud's streaming synthesis endpoint in the Qwen family.

Time to First Audio#26 / 28
754ms
TTFA Network Roundtrip#26 / 28
657ms
TTFA Leading Silence#18 / 28
96ms
Word Error Rate#28 / 28
8.9%

Overview

Alibaba serves the multilingual proprietary endpoint through Model Studio from an Asia-region deployment.

Qwen3 TTS Flash Realtime is tested every day on a fixed set of text prompts, measuring how quickly audible speech starts and how intelligible the result is.

Technical specifications

Hosted by
Alibaba Cloud
Source
Official API
Licensing
Proprietary
Deployment
Cloud
Region
Asia
Features
Multilingual

How Qwen3 TTS Flash Realtime ranks

Full TTS dashboard
Time to First Audio — every measured TTS modelMilliseconds · lower is better · 30-day averageEvery TTS model ranked on Time to First Audio, with Qwen3 TTS Flash Realtime highlighted.
  1. #1vui66 ms
  2. #3TTS Flash 291 ms
  3. #4Qwen3 TTS 1.7b106 ms
  4. #6TTS 2181 ms
  5. #7Flash v2.5194 ms
  6. #8Default235 ms
  7. #9TTS Rt v2245 ms
  8. #10TTS RT v1245 ms
  9. #11Mist v3258 ms
  10. #12Sonic 3.5276 ms
  11. #14Aura 2308 ms
  12. #15Coda312 ms
  13. #16S2.1 Pro335 ms
  14. #19S1379 ms
  15. #20Grok TTS397 ms
  16. #21Sonic 3.6423 ms
  17. #22Simba 3.2452 ms
  18. #23Simba 3.0471 ms
  19. #24Chirp 3 HD535 ms
  20. #25Falcon 2545 ms
Show all 28 models
  1. #27S2.1 Pro Free965 ms
  2. #28GPT-4o mini TTS1013 ms
median of all models · 310 ms
TTS models over the last 30 days, ranked on Time to First Audio.
#ModelHostTTFAWERSamples
1vuiFluxions66 ms9,450
2Qwen3 TTS FastNari71 ms2,190
3TTS Flash 2Inworld AI91 ms11,401
4Qwen3 TTS 1.7bBaseten106 ms420
5Palabra TTS v1Palabra115 ms11,385
6TTS 2Inworld AI181 ms11,401
7Flash v2.5ElevenLabs194 ms9,118
8DefaultGradium235 ms9,127
9TTS Rt v2Soniox245 ms11,232
10TTS RT v1Soniox245 ms11,234
11Mist v3Rime258 ms11,387
12Sonic 3.5Cartesia276 ms11,400
13Phantom Z 3.4 conversationalDeepdub286 ms11,396
14Aura 2Deepgram308 ms11,386
15CodaRime312 ms11,392
16S2.1 ProFish Audio335 ms11,400
17Eleven v3 ConversationalElevenLabs348 ms11,389
18Lightning v3.1 ProSmallest362 ms11,401
19S1Fish Audio379 ms11,393
20Grok TTSxAI397 ms11,386
21Sonic 3.6Cartesia423 ms8,210
22Simba 3.2Speechify452 ms11,393
23Simba 3.0Speechify471 ms11,396
24Chirp 3 HDGoogle535 ms11,400
25Falcon 2Murf545 ms11,397
26Qwen3 TTS Flash RealtimeAlibaba754 ms11,226
27S2.1 Pro FreeFish Audio965 ms11,366
28GPT-4o mini TTSOpenAI1013 ms11,370
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Latency vs accuracy

Where the errors come from

WER compositionQwen3 TTS Flash Realtime's Word Error Rate split by error type · 30-day averageQwen3 TTS Flash Realtime's WER split into substitutions, deletions and insertions.
  • Qwen3 TTS Flash Realtime8.9%
SubstitutionsDeletionsInsertions

Averages and tail latency

Averages hide slow outliers — these are the distributions behind each figure.

Qwen3 TTS Flash Realtime latency distributionMilliseconds · shared axis across metrics · last 30 daysQwen3 TTS Flash Realtime's latency percentiles per metric: p25–p75 band, p50 tick, whisker to p99.
  • Time to First Audiop50 709 ms · p99 4266 ms
  • TTFA Network Roundtripp50 617 ms · p99 4155 ms
  • TTFA Leading Silencep50 91 ms · p99 183 ms
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops
Average and percentile values per metric, with the number of samples behind each row.
MetricAveragep25p50p75p90p95p99Samples
Time to First Audio754 ms526 ms709 ms750 ms798 ms910 ms4266 ms11,226
TTFA Network Roundtrip657 ms431 ms617 ms655 ms695 ms776 ms4155 ms11,226
TTFA Leading Silence96 ms87 ms91 ms96 ms107 ms127 ms183 ms11,226
Word Error Rate8.9%0.0%5.6%12.5%25.0%31.6%50.0%11,206

Last 30 days

Daily medians from the same measurement runs · gaps are days without qualifying runs.

Time to First Audio — daily p50Line p50 · band p25–p75 · UTC daysQwen3 TTS Flash Realtime's daily median Time to First Audio over the last 30 days.
Qwen3 TTS Flash Realtime · Sep 1: 804 msQwen3 TTS Flash Realtime · Sep 2: 666 msQwen3 TTS Flash Realtime · Sep 3: 709 msQwen3 TTS Flash Realtime · Sep 4: 747 msQwen3 TTS Flash Realtime · Sep 5: 736 msQwen3 TTS Flash Realtime · Sep 6: 721 msQwen3 TTS Flash Realtime · Sep 7: 628 msQwen3 TTS Flash Realtime · Sep 8: 645 msQwen3 TTS Flash Realtime · Sep 9: 571 msQwen3 TTS Flash Realtime · Sep 10: 709 msQwen3 TTS Flash Realtime · Sep 11: 671 msQwen3 TTS Flash Realtime · Sep 12: 665 msQwen3 TTS Flash Realtime · Sep 13: 641 msQwen3 TTS Flash Realtime · Sep 14: 639 msQwen3 TTS Flash Realtime · Sep 15: 616 ms
Word Error Rate — daily averageDaily average · UTC daysQwen3 TTS Flash Realtime's daily Word Error Rate over the last 30 days.
Qwen3 TTS Flash Realtime · Sep 1: 4.8%Qwen3 TTS Flash Realtime · Sep 2: 9.4%Qwen3 TTS Flash Realtime · Sep 3: 8.2%Qwen3 TTS Flash Realtime · Sep 4: 8.8%Qwen3 TTS Flash Realtime · Sep 5: 10.8%Qwen3 TTS Flash Realtime · Sep 6: 9.3%Qwen3 TTS Flash Realtime · Sep 7: 8.8%Qwen3 TTS Flash Realtime · Sep 8: 9.4%Qwen3 TTS Flash Realtime · Sep 9: 10.0%Qwen3 TTS Flash Realtime · Sep 10: 8.4%Qwen3 TTS Flash Realtime · Sep 11: 9.8%Qwen3 TTS Flash Realtime · Sep 12: 8.5%Qwen3 TTS Flash Realtime · Sep 13: 9.5%Qwen3 TTS Flash Realtime · Sep 14: 9.3%Qwen3 TTS Flash Realtime · Sep 15: 10.4%

Time to First Audio by dataset

Qwen3 TTS Flash Realtime by test conditionMilliseconds · lower is better · best condition firstQwen3 TTS Flash Realtime's Time to First Audio on each benchmark dataset.
Time to First Audio per dataset, with the number of samples behind each figure.
DatasetTTFASamples
Text prompts754 ms11,226

Strongest condition: Text prompts at 754 ms · weakest: Text prompts at 754 ms.

How fast is Qwen3 TTS Flash Realtime?

On Alibaba Cloud, Qwen3 TTS Flash Realtime measures mean 754 ms time to first audio (26th of 28). Last measured 2026-09-15.

How accurate is Qwen3 TTS Flash Realtime?

On Alibaba Cloud, Qwen3 TTS Flash Realtime measures 8.9% word error rate (28th of 28). Last measured 2026-09-15.

Who hosts Qwen3 TTS Flash Realtime?

Qwen3 TTS Flash Realtime is created by Alibaba Cloud and served by Alibaba Cloud. Coval measures each hosted endpoint separately.

Limits of this comparison

The full identifier distinguishes this real-time configuration from other Qwen audio models.

  • Serving region contributes to roundtrip from Coval's US worker, so latency may differ for callers colocated in Asia. Coval separates network roundtrip from leading silence when those measurements are available.

Official sources

Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo