ALIBABA CLOUDTEXT-TO-SPEECH14,171 SAMPLES / 30 DAYSLAST RUN SEP 18, 2026, 02:30 UTC

Qwen3 TTS Fast text-to-speech benchmarks

Qwen3 TTS Fast, hosted by Nari, measures mean 70 ms time to first audio (2nd of 28) and 4.2% word error rate (3rd of 28) among TTS systems. Results cover the last 30 days. Coval benchmarks hosted endpoints daily using a consistent evaluation methodology. Last measured .

Coval has active text-to-speech measurements for Qwen3 TTS Fast, created by Alibaba and served on Nari.

TTFA Network Roundtrip#2 / 28
60ms
TTFA Leading Silence#3 / 28
9ms
Word Error Rate#3 / 28
4.2%

Overview

Qwen3 TTS Fast is tested every day on a fixed set of text prompts, measuring how quickly audible speech starts and how intelligible the result is.

Technical specifications

Hosted by
Nari
Source
Shared inference
Licensing
Open-weight
Deployment
Cloud
Region
US
Features
Multilingual

How Qwen3 TTS Fast ranks

Full TTS dashboard
Time to First Audio — every measured TTS modelMilliseconds · lower is better · 30-day averageEvery TTS model ranked on Time to First Audio, with Qwen3 TTS Fast highlighted.
  1. #1vui64 ms
  2. #3TTS Flash 291 ms
  3. #4Qwen3 TTS 1.7b105 ms
  4. #6TTS 2181 ms
  5. #7Flash v2.5193 ms
  6. #8Default236 ms
  7. #9TTS Rt v2245 ms
  8. #10TTS RT v1245 ms
  9. #11Mist v3258 ms
  10. #12Sonic 3.5278 ms
Show all 28 models
  1. #14Aura 2307 ms
  2. #15Coda311 ms
  3. #16S2.1 Pro336 ms
  4. #19S1380 ms
  5. #20Grok TTS399 ms
  6. #21Sonic 3.6412 ms
  7. #22Simba 3.2423 ms
  8. #23Simba 3.0447 ms
  9. #24Chirp 3 HD536 ms
  10. #25Falcon 2544 ms
  11. #27GPT-4o mini TTS1013 ms
  12. #28S2.1 Pro Free1100 ms
median of all models · 309 ms
TTS models over the last 30 days, ranked on Time to First Audio.
#ModelHostTTFAWERSamples
1vuiFluxions64 ms10,808
2Qwen3 TTS FastNari70 ms3,547
3TTS Flash 2Inworld AI91 ms12,761
4Qwen3 TTS 1.7bBaseten105 ms480
5Palabra TTS v1Palabra115 ms12,742
6TTS 2Inworld AI181 ms12,761
7Flash v2.5ElevenLabs193 ms10,477
8DefaultGradium236 ms10,477
9TTS Rt v2Soniox245 ms11,232
10TTS RT v1Soniox245 ms11,234
11Mist v3Rime258 ms12,747
12Sonic 3.5Cartesia278 ms12,760
13Phantom Z 3.4 conversationalDeepdub284 ms12,754
14Aura 2Deepgram307 ms12,745
15CodaRime311 ms12,752
16S2.1 ProFish Audio336 ms12,759
17Eleven v3 ConversationalElevenLabs346 ms12,748
18Lightning v3.1 ProSmallest363 ms12,761
19S1Fish Audio380 ms12,753
20Grok TTSxAI399 ms12,743
21Sonic 3.6Cartesia412 ms9,570
22Simba 3.2Speechify423 ms12,752
23Simba 3.0Speechify447 ms12,755
24Chirp 3 HDGoogle536 ms12,760
25Falcon 2Murf544 ms12,757
26Qwen3 TTS Flash RealtimeAlibaba740 ms12,582
27GPT-4o mini TTSOpenAI1013 ms12,717
28S2.1 Pro FreeFish Audio1100 ms12,710
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Latency vs accuracy

Where the errors come from

WER compositionQwen3 TTS Fast's Word Error Rate split by error type · 30-day averageQwen3 TTS Fast's WER split into substitutions, deletions and insertions.
  • Qwen3 TTS Fast4.2%
SubstitutionsDeletionsInsertions

Averages and tail latency

Averages hide slow outliers — these are the distributions behind each figure.

Qwen3 TTS Fast latency distributionMilliseconds · shared axis across metrics · last 30 daysQwen3 TTS Fast's latency percentiles per metric: p25–p75 band, p50 tick, whisker to p99.
  • Time to First Audiop50 63 ms · p99 129 ms
  • TTFA Network Roundtripp50 54 ms · p99 120 ms
  • TTFA Leading Silencep50 10 ms · p99 10 ms
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops
Average and percentile values per metric, with the number of samples behind each row.
MetricAveragep25p50p75p90p95p99Samples
Time to First Audio70 ms60 ms63 ms74 ms91 ms102 ms129 ms3,547
TTFA Network Roundtrip60 ms51 ms54 ms64 ms81 ms93 ms120 ms3,547
TTFA Leading Silence9 ms10 ms10 ms10 ms10 ms10 ms10 ms3,547
Word Error Rate4.2%0.0%0.0%6.3%12.5%20.0%28.0%3,530

Last 30 days

Daily medians from the same measurement runs · gaps are days without qualifying runs.

Time to First Audio — daily p50Line p50 · band p25–p75 · UTC daysQwen3 TTS Fast's daily median Time to First Audio over the last 30 days.
Qwen3 TTS Fast · Sep 10: 77 msQwen3 TTS Fast · Sep 11: 72 msQwen3 TTS Fast · Sep 12: 62 msQwen3 TTS Fast · Sep 13: 63 msQwen3 TTS Fast · Sep 14: 63 msQwen3 TTS Fast · Sep 15: 61 msQwen3 TTS Fast · Sep 16: 62 msQwen3 TTS Fast · Sep 17: 63 msQwen3 TTS Fast · Sep 18: 65 ms
Word Error Rate — daily averageDaily average · UTC daysQwen3 TTS Fast's daily Word Error Rate over the last 30 days.
Qwen3 TTS Fast · Sep 10: 3.7%Qwen3 TTS Fast · Sep 11: 3.9%Qwen3 TTS Fast · Sep 12: 3.6%Qwen3 TTS Fast · Sep 13: 4.2%Qwen3 TTS Fast · Sep 14: 3.9%Qwen3 TTS Fast · Sep 15: 3.7%Qwen3 TTS Fast · Sep 16: 3.7%Qwen3 TTS Fast · Sep 17: 4.3%Qwen3 TTS Fast · Sep 18: 4.0%

Time to First Audio by dataset

Qwen3 TTS Fast by test conditionMilliseconds · lower is better · best condition firstQwen3 TTS Fast's Time to First Audio on each benchmark dataset.
Time to First Audio per dataset, with the number of samples behind each figure.
DatasetTTFASamples
Text prompts70 ms3,547

Strongest condition: Text prompts at 70 ms · weakest: Text prompts at 70 ms.

How fast is Qwen3 TTS Fast?

On Nari, Qwen3 TTS Fast measures mean 70 ms time to first audio (2nd of 28). Last measured 2026-09-18.

How accurate is Qwen3 TTS Fast?

On Nari, Qwen3 TTS Fast measures 4.2% word error rate (3rd of 28). Last measured 2026-09-18.

Who hosts Qwen3 TTS Fast?

Qwen3 TTS Fast is created by Alibaba Cloud and served by Nari. Coval measures each hosted endpoint separately.

Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo