GRADIUMTEXT-TO-SPEECH20,408 SAMPLES / 30 DAYSLAST RUN OCT 5, 2026, 16:00 UTC

TTS Beta text-to-speech benchmarks

TTS Beta, hosted by Gradium, measures mean 54 ms time to first audio (2nd of 32) and 4.1% word error rate (5th of 32) among TTS systems. Results cover the last 30 days. Coval benchmarks hosted endpoints daily using a consistent evaluation methodology. Last measured .

Coval has active text-to-speech measurements for TTS Beta, created by Gradium and served through Gradium's own API.

TTFA Network Roundtrip#2 / 32
51ms
TTFA Leading Silence#2 / 32
3ms
Word Error Rate#5 / 32
4.1%

Overview

TTS Beta is tested every day on a fixed set of text prompts, measuring how quickly audible speech starts and how intelligible the result is.

Technical specifications

Made by
Gradium
Hosted by
Gradium
Source
Official API
Licensing
Proprietary
Deployment
Cloud
Region
US
Features
Multilingual, Voice cloning

How TTS Beta ranks

Full TTS dashboard
Time to First Audio — every measured TTS modelMilliseconds · lower is better · 30-day averageEvery TTS model ranked on Time to First Audio, with TTS Beta highlighted.
  1. #1vui54 ms
  2. #2TTS Beta54 ms
  3. #4TTS Flash 283 ms
  4. #5Qwen3 TTS 1.7b109 ms
  5. #7TTS 2183 ms
  6. #8Flash v2.5188 ms
  7. #10Default207 ms
  8. #11Flux TTS209 ms
  9. #12TTS Rt v2256 ms
Show all 32 models
  1. #13TTS RT v1258 ms
  2. #14Mist v3259 ms
  3. #16Sonic 3.5285 ms
  4. #17Simba 3.2287 ms
  5. #18Coda298 ms
  6. #19Aura 2301 ms
  7. #20Simba 3.0302 ms
  8. #22S2.1 Pro343 ms
  9. #23Sonic 3.6354 ms
  10. #25S1382 ms
  11. #26Grok TTS398 ms
  12. #27Falcon 2521 ms
  13. #28Chirp 3 HD545 ms
  14. #29Aura 2 En550 ms
  15. #31S2.1 Pro Free1002 ms
  16. #32GPT-4o mini TTS1185 ms
median of all models · 286 ms
TTS models over the last 30 days, ranked on Time to First Audio.
#ModelHostTTFAWERSamples
1vuiFluxions54 ms9,377
2Gradium TTS Beta 202609Gradium54 ms5,102
3Qwen3 TTS FastNari Labs70 ms7,489
4TTS Flash 2Inworld AI83 ms9,716
5Qwen3 TTS 1.7bBaseten109 ms1,045
6Palabra TTS v1Palabra115 ms9,670
7TTS 2Inworld AI183 ms9,713
8Flash v2.5ElevenLabs188 ms9,897
9Eleven v4 TurboElevenLabs203 ms362
10DefaultGradium207 ms9,902
11Flux TTSDeepgram209 ms9,800
12TTS Rt v2Soniox256 ms8,101
13TTS RT v1Soniox258 ms8,101
14Mist v3Rime259 ms9,462
15Phantom Z 3.4 conversationalDeepdub273 ms9,642
16Sonic 3.5Cartesia285 ms9,912
17Simba 3.2SpeechifyAI287 ms9,892
18CodaRime298 ms9,462
19Aura 2Deepgram301 ms9,840
20Simba 3.0SpeechifyAI302 ms9,899
21Eleven v3 ConversationalElevenLabs325 ms9,897
22S2.1 ProFish Audio343 ms9,911
23Sonic 3.6Cartesia354 ms9,912
24Lightning v3.1 ProSmallest365 ms9,912
25S1Fish Audio382 ms9,908
26Grok TTSSpaceXAI398 ms9,885
27Falcon 2Murf521 ms9,910
28Chirp 3 HDGoogle545 ms9,912
29Aura 2 EnCloudflare550 ms1,522
30Qwen3 TTS Flash RealtimeAlibaba690 ms9,591
31S2.1 Pro FreeFish Audio1002 ms9,884
32GPT-4o mini TTSOpenAI1185 ms9,833
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Latency vs accuracy

Where the errors come from

WER compositionTTS Beta's Word Error Rate split by error type · 30-day averageTTS Beta's WER split into substitutions, deletions and insertions.
  • TTS Beta4.1%
SubstitutionsDeletionsInsertions

Averages and tail latency

Averages hide slow outliers — these are the distributions behind each figure.

TTS Beta latency distributionMilliseconds · shared axis across metrics · last 30 daysTTS Beta's latency percentiles per metric: p25–p75 band, p50 tick, whisker to p99.
  • Time to First Audiop50 48 ms · p99 110 ms
  • TTFA Network Roundtripp50 47 ms · p99 91 ms
  • TTFA Leading Silencep50 0 ms · p99 59 ms
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops
Average and percentile values per metric, with the number of samples behind each row.
MetricAveragep25p50p75p90p95p99Samples
Time to First Audio54 ms45 ms48 ms58 ms75 ms89 ms110 ms5,102
TTFA Network Roundtrip51 ms45 ms47 ms53 ms62 ms73 ms91 ms5,102
TTFA Leading Silence3 ms0 ms0 ms0 ms4 ms34 ms59 ms5,102
Word Error Rate4.1%0.0%0.0%7.7%18.8%24.0%35.7%5,102

Last 30 days

Daily medians from the same measurement runs · gaps are days without qualifying runs.

Time to First Audio — daily p50Line p50 · band p25–p75 · UTC daysTTS Beta's daily median Time to First Audio over the last 30 days.
TTS Beta · Sep 15: 47 msTTS Beta · Sep 16: 46 msTTS Beta · Sep 17: 45 msTTS Beta · Sep 18: 46 msTTS Beta · Sep 19: 45 msTTS Beta · Sep 20: 45 msTTS Beta · Sep 21: 46 msTTS Beta · Sep 22: 48 msTTS Beta · Sep 23: 59 msTTS Beta · Sep 24: 49 msTTS Beta · Sep 25: 53 msTTS Beta · Sep 26: 51 msTTS Beta · Sep 27: 58 msTTS Beta · Sep 28: 53 msTTS Beta · Sep 29: 61 msTTS Beta · Sep 30: 63 msTTS Beta · Oct 1: 67 msTTS Beta · Oct 2: 67 msTTS Beta · Oct 3: 60 msTTS Beta · Oct 4: 52 msTTS Beta · Oct 5: 64 ms
Word Error Rate — daily averageDaily average · UTC daysTTS Beta's daily Word Error Rate over the last 30 days.
TTS Beta · Sep 15: 4.9%TTS Beta · Sep 16: 5.2%TTS Beta · Sep 17: 6.0%TTS Beta · Sep 18: 6.5%TTS Beta · Sep 19: 5.3%TTS Beta · Sep 20: 5.9%TTS Beta · Sep 21: 6.3%TTS Beta · Sep 22: 6.5%TTS Beta · Sep 23: 6.2%TTS Beta · Sep 24: 4.2%TTS Beta · Sep 25: 4.4%TTS Beta · Sep 26: 3.0%TTS Beta · Sep 27: 5.7%TTS Beta · Sep 28: 4.0%TTS Beta · Sep 29: 3.8%TTS Beta · Sep 30: 3.6%TTS Beta · Oct 1: 5.5%TTS Beta · Oct 2: 5.1%TTS Beta · Oct 3: 4.7%TTS Beta · Oct 4: 8.9%TTS Beta · Oct 5: 2.7%

Time to First Audio by dataset

TTS Beta by test conditionMilliseconds · lower is better · best condition firstTTS Beta's Time to First Audio on each benchmark dataset.
Time to First Audio per dataset, with the number of samples behind each figure.
DatasetTTFASamples
Text prompts53 ms4,050
tts-v261 ms1,052

Strongest condition: Text prompts at 53 ms · weakest: tts-v2 at 61 ms.

How fast is TTS Beta?

On Gradium, TTS Beta measures mean 54 ms time to first audio (2nd of 32). Last measured 2026-10-05.

How accurate is TTS Beta?

On Gradium, TTS Beta measures 4.1% word error rate (5th of 32). Last measured 2026-10-05.

Who hosts TTS Beta?

TTS Beta is created by Gradium and served by Gradium. Coval measures each hosted endpoint separately.

Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo