DEEPGRAMTEXT-TO-SPEECH39,116 SAMPLES / 30 DAYSLAST RUN OCT 5, 2026, 17:00 UTC

Flux TTS text-to-speech benchmarks

Flux TTS, hosted by Deepgram, measures mean 209 ms time to first audio (11th of 32) and 4.9% word error rate (17th of 32) among TTS systems. Results cover the last 30 days. Coval benchmarks hosted endpoints daily using a consistent evaluation methodology. Last measured .

Coval has active text-to-speech measurements for Flux TTS, created by Deepgram and served through Deepgram's own API.

Time to First Audio#11 / 32
209ms
TTFA Network Roundtrip#12 / 32
143ms
TTFA Leading Silence#17 / 32
65ms
Word Error Rate#17 / 32
4.9%

Overview

Flux TTS is tested every day on a fixed set of text prompts, measuring how quickly audible speech starts and how intelligible the result is.

Technical specifications

Made by
Deepgram
Hosted by
Deepgram
Source
Official API
Licensing
Proprietary
Deployment
On-prem
Region
US

How Flux TTS ranks

Full TTS dashboard
Time to First Audio — every measured TTS modelMilliseconds · lower is better · 30-day averageEvery TTS model ranked on Time to First Audio, with Flux TTS highlighted.
  1. #1vui54 ms
  2. #2TTS Beta54 ms
  3. #4TTS Flash 283 ms
  4. #5Qwen3 TTS 1.7b109 ms
  5. #7TTS 2183 ms
  6. #8Flash v2.5188 ms
  7. #10Default207 ms
  8. #11Flux TTS209 ms
  9. #12TTS Rt v2256 ms
Show all 32 models
  1. #13TTS RT v1258 ms
  2. #14Mist v3260 ms
  3. #16Sonic 3.5285 ms
  4. #17Simba 3.2286 ms
  5. #18Coda298 ms
  6. #19Aura 2301 ms
  7. #20Simba 3.0302 ms
  8. #22S2.1 Pro343 ms
  9. #23Sonic 3.6354 ms
  10. #25S1382 ms
  11. #26Grok TTS398 ms
  12. #27Falcon 2521 ms
  13. #28Chirp 3 HD545 ms
  14. #29Aura 2 En550 ms
  15. #31S2.1 Pro Free1003 ms
  16. #32GPT-4o mini TTS1185 ms
median of all models · 286 ms
TTS models over the last 30 days, ranked on Time to First Audio.
#ModelHostTTFAWERSamples
1vuiFluxions54 ms9,379
2Gradium TTS Beta 202609Gradium54 ms5,106
3Qwen3 TTS FastNari Labs70 ms7,493
4TTS Flash 2Inworld AI83 ms9,700
5Qwen3 TTS 1.7bBaseten109 ms1,045
6Palabra TTS v1Palabra115 ms9,654
7TTS 2Inworld AI183 ms9,697
8Flash v2.5ElevenLabs188 ms9,881
9Eleven v4 TurboElevenLabs203 ms366
10DefaultGradium207 ms9,886
11Flux TTSDeepgram209 ms9,784
12TTS Rt v2Soniox256 ms8,085
13TTS RT v1Soniox258 ms8,085
14Mist v3Rime260 ms9,442
15Phantom Z 3.4 conversationalDeepdub273 ms9,626
16Sonic 3.5Cartesia285 ms9,896
17Simba 3.2SpeechifyAI286 ms9,876
18CodaRime298 ms9,442
19Aura 2Deepgram301 ms9,824
20Simba 3.0SpeechifyAI302 ms9,883
21Eleven v3 ConversationalElevenLabs325 ms9,881
22S2.1 ProFish Audio343 ms9,895
23Sonic 3.6Cartesia354 ms9,896
24Lightning v3.1 ProSmallest365 ms9,896
25S1Fish Audio382 ms9,892
26Grok TTSSpaceXAI398 ms9,869
27Falcon 2Murf521 ms9,894
28Chirp 3 HDGoogle545 ms9,896
29Aura 2 EnCloudflare550 ms1,526
30Qwen3 TTS Flash RealtimeAlibaba688 ms9,584
31S2.1 Pro FreeFish Audio1003 ms9,868
32GPT-4o mini TTSOpenAI1185 ms9,817
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Latency vs accuracy

Where the errors come from

WER compositionFlux TTS's Word Error Rate split by error type · 30-day averageFlux TTS's WER split into substitutions, deletions and insertions.
  • Flux TTS4.9%
SubstitutionsDeletionsInsertions

Averages and tail latency

Averages hide slow outliers — these are the distributions behind each figure.

Flux TTS latency distributionMilliseconds · shared axis across metrics · last 30 daysFlux TTS's latency percentiles per metric: p25–p75 band, p50 tick, whisker to p99.
  • Time to First Audiop50 195 ms · p99 551 ms
  • TTFA Network Roundtripp50 141 ms · p99 208 ms
  • TTFA Leading Silencep50 54 ms · p99 398 ms
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops
Average and percentile values per metric, with the number of samples behind each row.
MetricAveragep25p50p75p90p95p99Samples
Time to First Audio209 ms169 ms195 ms220 ms247 ms302 ms551 ms9,784
TTFA Network Roundtrip143 ms127 ms141 ms163 ms179 ms186 ms208 ms9,784
TTFA Leading Silence65 ms38 ms54 ms66 ms80 ms133 ms398 ms9,784
Word Error Rate4.9%0.0%0.0%6.3%20.0%21.4%36.0%9,764

Last 30 days

Daily medians from the same measurement runs · gaps are days without qualifying runs.

Time to First Audio — daily p50Line p50 · band p25–p75 · UTC daysFlux TTS's daily median Time to First Audio over the last 30 days.
Flux TTS · Sep 5: 155 msFlux TTS · Sep 6: 194 msFlux TTS · Sep 7: 163 msFlux TTS · Sep 8: 205 msFlux TTS · Sep 9: 172 msFlux TTS · Sep 10: 182 msFlux TTS · Sep 11: 199 msFlux TTS · Sep 12: 199 msFlux TTS · Sep 13: 179 msFlux TTS · Sep 14: 202 msFlux TTS · Sep 15: 203 msFlux TTS · Sep 16: 180 msFlux TTS · Sep 17: 207 msFlux TTS · Sep 18: 187 msFlux TTS · Sep 19: 194 msFlux TTS · Sep 20: 214 msFlux TTS · Sep 21: 193 msFlux TTS · Sep 22: 206 msFlux TTS · Sep 23: 189 msFlux TTS · Sep 24: 189 msFlux TTS · Sep 25: 200 msFlux TTS · Sep 26: 189 msFlux TTS · Sep 27: 207 msFlux TTS · Sep 28: 200 msFlux TTS · Sep 29: 196 msFlux TTS · Sep 30: 203 msFlux TTS · Oct 1: 192 msFlux TTS · Oct 2: 166 msFlux TTS · Oct 3: 234 msFlux TTS · Oct 4: 174 msFlux TTS · Oct 5: 216 ms
Word Error Rate — daily averageDaily average · UTC daysFlux TTS's daily Word Error Rate over the last 30 days.
Flux TTS · Sep 5: 4.8%Flux TTS · Sep 6: 6.7%Flux TTS · Sep 7: 3.6%Flux TTS · Sep 8: 6.5%Flux TTS · Sep 9: 5.5%Flux TTS · Sep 10: 5.9%Flux TTS · Sep 11: 5.1%Flux TTS · Sep 12: 7.0%Flux TTS · Sep 13: 8.7%Flux TTS · Sep 14: 5.9%Flux TTS · Sep 15: 4.8%Flux TTS · Sep 16: 5.8%Flux TTS · Sep 17: 6.3%Flux TTS · Sep 18: 7.1%Flux TTS · Sep 19: 5.4%Flux TTS · Sep 20: 5.1%Flux TTS · Sep 21: 4.3%Flux TTS · Sep 22: 8.0%Flux TTS · Sep 23: 6.5%Flux TTS · Sep 24: 2.9%Flux TTS · Sep 25: 7.4%Flux TTS · Sep 26: 5.2%Flux TTS · Sep 27: 6.2%Flux TTS · Sep 28: 5.0%Flux TTS · Sep 29: 4.7%Flux TTS · Sep 30: 2.7%Flux TTS · Oct 1: 8.3%Flux TTS · Oct 2: 6.0%Flux TTS · Oct 3: 6.2%Flux TTS · Oct 4: 10.6%Flux TTS · Oct 5: 3.1%

Time to First Audio by dataset

Flux TTS by test conditionMilliseconds · lower is better · best condition firstFlux TTS's Time to First Audio on each benchmark dataset.
  1. tts-v2207 ms
Time to First Audio per dataset, with the number of samples behind each figure.
DatasetTTFASamples
Text prompts209 ms8,837
tts-v2207 ms947

Strongest condition: tts-v2 at 207 ms · weakest: Text prompts at 209 ms.

How fast is Flux TTS?

On Deepgram, Flux TTS measures mean 209 ms time to first audio (11th of 32). Last measured 2026-10-05.

How accurate is Flux TTS?

On Deepgram, Flux TTS measures 4.9% word error rate (17th of 32). Last measured 2026-10-05.

Who hosts Flux TTS?

Flux TTS is created by Deepgram and served by Deepgram. Coval measures each hosted endpoint separately.

Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo