GRADIUMTEXT-TO-SPEECH16,548 SAMPLES / 30 DAYSLAST RUN SEP 4, 2026, 20:30 UTC
Default text-to-speech benchmarks
Coval has active text-to-speech measurements for Default, created by Gradium and served through Gradium's own API.
- Time to First Audio#5 / 26
- 236ms
- TTFA Network Roundtrip#13 / 26
- 230ms
- TTFA Leading Silence#2 / 26
- 6ms
- Word Error Rate#18 / 26
- 5.2%
Overview
Default is tested every day on a fixed set of text prompts, measuring how quickly audible speech starts and how intelligible the result is.
How Default ranks
Full TTS dashboardShow all 26 modelsShow fewer
Show all 26 modelsShow fewer
| # | Model | Host | TTFA | WER | Samples |
|---|---|---|---|---|---|
| 1 | vui | Fluxions | 110 ms | 10,720 | |
| 2 | Palabra TTS v1 | Palabra | 116 ms | 13,690 | |
| 3 | TTS Flash 2 | Inworld AI | 118 ms | 11,379 | |
| 4 | TTS 2 | Inworld AI | 176 ms | 13,828 | |
| 5 | Default | Gradium | 236 ms | 4,137 | |
| 6 | Mist v3 | Rime | 257 ms | 13,824 | |
| 7 | TTS Rt v2 | Soniox | 258 ms | 11,509 | |
| 8 | TTS RT v1 | Soniox | 264 ms | 13,829 | |
| 9 | Sonic 3.5 | Cartesia | 274 ms | 13,828 | |
| 10 | Phantom Z 3.4 conversational | Deepdub | 302 ms | 10,041 | |
| 11 | Coda | Rime | 319 ms | 13,819 | |
| 12 | Aura 2 | Deepgram | 322 ms | 13,803 | |
| 13 | Flash v2.5 | ElevenLabs | 357 ms | 8,559 | |
| 14 | S2.1 Pro | Fish Audio | 363 ms | 12,882 | |
| 15 | Eleven v3 Conversational | ElevenLabs | 396 ms | 9,410 | |
| 16 | Grok TTS | xAI | 417 ms | 13,823 | |
| 17 | S1 | Fish Audio | 421 ms | 12,893 | |
| 18 | Simba 3.2 | Speechify | 447 ms | 13,821 | |
| 19 | Lightning v3.1 Pro | Smallest | 463 ms | 13,814 | |
| 20 | Sonic 3.6 | Cartesia | 465 ms | 3,220 | |
| 21 | Simba 3.0 | Speechify | 469 ms | 13,825 | |
| 22 | Chirp 3 HD | 518 ms | 13,829 | ||
| 23 | Falcon 2 | Murf | 549 ms | 12,885 | |
| 24 | Qwen3 TTS Flash Realtime | Alibaba | 685 ms | 13,791 | |
| 25 | S2.1 Pro Free | Fish Audio | 902 ms | 13,773 | |
| 26 | GPT-4o mini TTS | OpenAI | 1033 ms | 13,816 |
Latency vs accuracy
Where the errors come from
- Default5.2%
Averages and tail latency
Averages hide slow outliers — these are the distributions behind each figure.
- Time to First Audiop50 214 ms · p99 386 ms
- TTFA Network Roundtripp50 213 ms · p99 359 ms
- TTFA Leading Silencep50 0 ms · p99 72 ms
- Defaultp50 0.0% · p99 32.0%
| Metric | Average | p25 | p50 | p75 | p90 | p95 | p99 | Samples |
|---|---|---|---|---|---|---|---|---|
| Time to First Audio | 236 ms | 212 ms | 214 ms | 237 ms | 331 ms | 349 ms | 386 ms | 4,137 |
| TTFA Network Roundtrip | 230 ms | 212 ms | 213 ms | 217 ms | 329 ms | 348 ms | 359 ms | 4,137 |
| TTFA Leading Silence | 6 ms | 0 ms | 0 ms | 0 ms | 28 ms | 49 ms | 72 ms | 4,137 |
| Word Error Rate | 5.2% | 0.0% | 0.0% | 7.7% | 18.8% | 21.4% | 32.0% | 4,137 |
Last 30 days
Daily medians from the same measurement runs · gaps are days without qualifying runs.
Time to First Audio by dataset
- Text prompts236 ms
| Dataset | TTFA | Samples |
|---|---|---|
| Text prompts | 236 ms | 4,137 |
Strongest condition: Text prompts at 236 ms · weakest: Text prompts at 236 ms.
Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.
Evaluate your own voice agent
Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.