BENCHMARKTTS30 MODELS RANKEDLAST 30 DAYS

Time to First Audio (TTFA)

Time to First Audio (TTFA) is the wait between sending text to a text-to-speech API and the first audible sample a listener would hear, including any leading silence at the start of the stream.

Current TTS leader#1 / 30
116ms
Palabra TTS v1via Palabra

How it is calculated

TTFA = timestamp of the first audible output sample − synthesis request timestamp.

How to read it

Unit
ms
Better
Lower
Period
Rolling 30 days
Cadence
Re-measured daily

Text-to-Speech models on Time to First Audio

Full TTS dashboard
Time to First Audio — every measured TTS modelMilliseconds · lower is better · 30-day averageEvery TTS model ranked on Time to First Audio.
  1. #2vui124 ms
  2. #3TTS Flash 2128 ms
  3. #4TTS 2176 ms
  4. #5Blizzard235 ms
  5. #6Neural236 ms
  6. #7Mist v3256 ms
  7. #8TTS Rt v2262 ms
  8. #9Sonic 3.5274 ms
  9. #10TTS RT v1275 ms
  10. #12Coda313 ms
Show all 30 models
  1. #13Aura 2328 ms
  2. #14S2.1 Pro374 ms
  3. #15Default384 ms
  4. #18Grok TTS420 ms
  5. #19S1434 ms
  6. #20Flash v2.5455 ms
  7. #21Speech 2.8 HD460 ms
  8. #22Sonic 3.6466 ms
  9. #23Simba 3.2484 ms
  10. #24Chirp 3 HD512 ms
  11. #25Simba 3.0526 ms
  12. #26Falcon 2549 ms
  13. #29S2.1 Pro Free806 ms
  14. #30GPT-4o mini TTS1075 ms
median of all models · 397 ms
TTS models over the last 30 days, ranked on Time to First Audio.
#ModelHostTTFAWERSamples
1Palabra TTS v1Palabra116 ms5.9%14,396
2vuiFluxions124 ms8,624
3TTS Flash 2Inworld AI128 ms8,719
4TTS 2Inworld AI176 ms4.8%14,529
5BlizzardLmnt235 ms7.4%14,117
6NeuralAzure236 ms4.3%3,350
7Mist v3Rime256 ms6.3%14,524
8TTS Rt v2Soniox262 ms8,849
9Sonic 3.5Cartesia274 ms6.1%14,513
10TTS RT v1Soniox275 ms3.7%14,528
11Dragon HD LatestAzure310 ms5.1%3,350
12CodaRime313 ms5.2%14,523
13Aura 2Deepgram328 ms5.3%14,501
14S2.1 ProFish Audio374 ms10,222
15DefaultGradium384 ms4.6%14,002
16Speech 2.8 TurboMiniMax411 ms4.8%1,997
17Eleven v3 ConversationalElevenLabs412 ms6,750
18Grok TTSxAI420 ms4.7%14,524
19S1Fish Audio434 ms4.9%10,236
20Flash v2.5ElevenLabs455 ms6.7%9,259
21Speech 2.8 HDMiniMax460 ms1,995
22Sonic 3.6Cartesia466 ms560
23Simba 3.2Speechify484 ms4.7%14,525
24Chirp 3 HDGoogle512 ms5.2%14,530
25Simba 3.0Speechify526 ms5.3%14,526
26Falcon 2Murf549 ms10,229
27Lightning v3.1 ProSmallest586 ms4.4%14,515
28Qwen3 TTS Flash RealtimeAlibaba645 ms8.8%14,530
29S2.1 Pro FreeFish Audio806 ms4.7%14,464
30GPT-4o mini TTSOpenAI1075 ms4.8%14,517
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Tail latency

The distribution behind each average, ranked by median TTFA.

Time to First Audio distribution per modelMilliseconds · shared axis · last 30 daysTime to First Audio percentile spans for every measured TTS model.
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops

Last 30 days

Daily median for the current top 5 · gaps are days without qualifying runs.

Time to First Audio — current leadersDaily p50 per model · UTC daysDaily Time to First Audio for the current top TTS models over the last 30 days.
Blizzard · Jul 31: 210 msBlizzard · Aug 1: 192 msBlizzard · Aug 2: 215 msBlizzard · Aug 3: 193 msBlizzard · Aug 4: 201 msBlizzard · Aug 5: 208 msBlizzard · Aug 6: 191 msBlizzard · Aug 7: 214 msBlizzard · Aug 8: 230 msBlizzard · Aug 9: 202 msBlizzard · Aug 10: 219 msBlizzard · Aug 11: 208 msBlizzard · Aug 12: 202 msBlizzard · Aug 13: 192 msBlizzard · Aug 14: 199 msBlizzard · Aug 15: 247 msBlizzard · Aug 16: 213 msBlizzard · Aug 17: 218 msBlizzard · Aug 18: 209 msBlizzard · Aug 19: 212 msBlizzard · Aug 20: 196 msBlizzard · Aug 21: 250 msBlizzard · Aug 22: 197 msBlizzard · Aug 23: 213 msBlizzard · Aug 24: 219 msBlizzard · Aug 25: 248 msBlizzard · Aug 26: 217 msBlizzard · Aug 27: 224 msBlizzard · Aug 28: 217 msPalabra TTS v1 · Jul 31: 104 msPalabra TTS v1 · Aug 1: 105 msPalabra TTS v1 · Aug 2: 114 msPalabra TTS v1 · Aug 3: 102 msPalabra TTS v1 · Aug 4: 106 msPalabra TTS v1 · Aug 5: 107 msPalabra TTS v1 · Aug 6: 107 msPalabra TTS v1 · Aug 7: 103 msPalabra TTS v1 · Aug 8: 111 msPalabra TTS v1 · Aug 9: 104 msPalabra TTS v1 · Aug 10: 101 msPalabra TTS v1 · Aug 11: 109 msPalabra TTS v1 · Aug 12: 108 msPalabra TTS v1 · Aug 13: 106 msPalabra TTS v1 · Aug 14: 104 msPalabra TTS v1 · Aug 15: 105 msPalabra TTS v1 · Aug 16: 111 msPalabra TTS v1 · Aug 17: 101 msPalabra TTS v1 · Aug 18: 102 msPalabra TTS v1 · Aug 19: 106 msPalabra TTS v1 · Aug 20: 106 msPalabra TTS v1 · Aug 21: 105 msPalabra TTS v1 · Aug 22: 106 msPalabra TTS v1 · Aug 23: 105 msPalabra TTS v1 · Aug 24: 104 msPalabra TTS v1 · Aug 25: 104 msPalabra TTS v1 · Aug 26: 107 msPalabra TTS v1 · Aug 27: 111 msPalabra TTS v1 · Aug 28: 100 msTTS 2 · Jul 31: 152 msTTS 2 · Aug 1: 144 msTTS 2 · Aug 2: 159 msTTS 2 · Aug 3: 153 msTTS 2 · Aug 4: 163 msTTS 2 · Aug 5: 179 msTTS 2 · Aug 6: 158 msTTS 2 · Aug 7: 158 msTTS 2 · Aug 8: 159 msTTS 2 · Aug 9: 150 msTTS 2 · Aug 10: 167 msTTS 2 · Aug 11: 154 msTTS 2 · Aug 12: 164 msTTS 2 · Aug 13: 152 msTTS 2 · Aug 14: 157 msTTS 2 · Aug 15: 155 msTTS 2 · Aug 16: 164 msTTS 2 · Aug 17: 158 msTTS 2 · Aug 18: 165 msTTS 2 · Aug 19: 149 msTTS 2 · Aug 20: 159 msTTS 2 · Aug 21: 164 msTTS 2 · Aug 22: 157 msTTS 2 · Aug 23: 167 msTTS 2 · Aug 24: 162 msTTS 2 · Aug 25: 174 msTTS 2 · Aug 26: 165 msTTS 2 · Aug 27: 176 msTTS 2 · Aug 28: 155 msTTS Flash 2 · Aug 10: 205 msTTS Flash 2 · Aug 11: 200 msTTS Flash 2 · Aug 12: 181 msTTS Flash 2 · Aug 13: 161 msTTS Flash 2 · Aug 14: 112 msTTS Flash 2 · Aug 15: 114 msTTS Flash 2 · Aug 16: 116 msTTS Flash 2 · Aug 17: 121 msTTS Flash 2 · Aug 18: 114 msTTS Flash 2 · Aug 19: 120 msTTS Flash 2 · Aug 20: 108 msTTS Flash 2 · Aug 21: 117 msTTS Flash 2 · Aug 22: 117 msTTS Flash 2 · Aug 23: 118 msTTS Flash 2 · Aug 24: 119 msTTS Flash 2 · Aug 25: 66 msTTS Flash 2 · Aug 26: 70 msTTS Flash 2 · Aug 27: 72 msTTS Flash 2 · Aug 28: 74 msvui · Aug 6: 159 msvui · Aug 7: 200 msvui · Aug 8: 140 msvui · Aug 9: 119 msvui · Aug 10: 114 msvui · Aug 11: 112 msvui · Aug 12: 110 msvui · Aug 13: 108 msvui · Aug 14: 106 msvui · Aug 15: 123 msvui · Aug 16: 95 msvui · Aug 17: 98 msvui · Aug 18: 109 msvui · Aug 19: 109 msvui · Aug 20: 98 msvui · Aug 21: 119 msvui · Aug 22: 82 msvui · Aug 23: 95 msvui · Aug 24: 103 msvui · Aug 25: 104 msvui · Aug 26: 100 msvui · Aug 27: 35 msvui · Aug 28: 50 ms
BlizzardPalabra TTS v1TTS 2TTS Flash 2vui

About TTFA

Why it matters

TTFA is the text-to-speech portion of a voice agent's response delay. Transcription and language-model processing add separate delays before the response reaches the caller.

The measurement includes leading silence because audio bytes can arrive before the stream contains audible speech.

How Coval measures it

Every model synthesizes the same fixed text prompts, re-measured daily. The clock starts at the synthesis request and stops at the first audible sample, so any leading silence the provider streams counts too.

Connection setup (TCP, TLS and handshakes) is excluded for every provider. Coval's workers run in us-east-1, so the result still includes the round trip to the provider's serving region. Model pages separate network roundtrip and leading silence where those measurements are available.

Caveats and interpretation

  • Voice, prompt length, synthesis format, region and connection reuse can affect production timing. Coval fixes the prompt and connection treatment so model comparisons remain consistent.
  • TTFA measures when speech begins, not how natural or appropriate the completed voice sounds.

The datasets behind it

Every model runs the same fixed inputs, so a gap in TTFA is the model's doing — not the test's.

Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo