BENCHMARKSTT24 MODELS RANKEDLAST 30 DAYS
Time to First Token (TTFT)
Time to First Token (TTFT) is how quickly a speech-to-text model starts streaming partial transcripts after audio is sent.
How it is calculated
TTFT = first partial-transcript timestamp − start of the measured audio request.
How to read it
- Unit
- ms
- Better
- Lower
- Period
- Rolling 30 days
- Cadence
- Re-measured daily
Speech-to-Text models on Time to First Token
Full STT dashboard- #9Defaultvia Speechmatics1473 ms
Show all 24 modelsShow fewer
- #16Defaultvia Azure1792 ms
- #20Defaultvia Gradium1979 ms
| # | Model | Host | TTFS | WER | TTFT | Samples |
|---|---|---|---|---|---|---|
| 1 | Universal 3.5 Pro | AssemblyAI | 146 ms | 1030 ms | 29,317 | |
| 2 | Flux | Deepgram | — | 1089 ms | 29,354 | |
| 3 | Flux Multilingual | Deepgram | — | 1175 ms | 29,344 | |
| 4 | Parakeet TDT 0.6B v3 | Together AI | 70 ms | 1210 ms | 29,187 | |
| 5 | Whisper Large v3 | Together AI | 180 ms | 1241 ms | 29,133 | |
| 6 | Nova 3 | Deepgram | 99 ms | 1434 ms | 29,335 | |
| 7 | Nova 2 | Deepgram | 101 ms | 1436 ms | 29,310 | |
| 8 | STT 1 | Inworld AI | 83 ms | 1468 ms | 29,321 | |
| 9 | Default | Speechmatics | 223 ms | 1473 ms | 29,353 | |
| 10 | Universal Streaming | AssemblyAI | — | 1510 ms | 29,297 | |
| 11 | STT RT v5 | Soniox | 64 ms | 1533 ms | 29,363 | |
| 12 | Enhanced | Speechmatics | 341 ms | 1536 ms | 29,356 | |
| 13 | Nemotron 3.5 ASR Streaming | Together AI | — | 1540 ms | 29,193 | |
| 14 | Velma 2 STT Streaming | Modulate | 191 ms | 1576 ms | 17,919 | |
| 15 | Solaria 1 | Gladia | 680 ms | 1703 ms | 26,391 | |
| 16 | Default | Azure | 155 ms | 1792 ms | 6,689 | |
| 17 | Ink 2 | Cartesia | 108 ms | 1812 ms | 29,329 | |
| 18 | GPT Realtime Whisper | OpenAI | 559 ms | 1823 ms | 29,327 | |
| 19 | Voxtral Mini Transcribe Realtime 2602 | Mistral | 356 ms | 1828 ms | 29,206 | |
| 20 | Default | Gradium | 249 ms | 1979 ms | 28,273 | |
| 21 | Pulse | Smallest | 205 ms | 2072 ms | 29,354 | |
| 22 | Scribe v2 Realtime | ElevenLabs | 120 ms | 2157 ms | 29,245 | |
| 23 | Chirp 3 | 813 ms | 5999 ms | 29,360 | ||
| 24 | Chirp 2 | 811 ms | 6000 ms | 29,278 | ||
| — | GPT-4o mini Transcribe | OpenAI | 623 ms | — | 29,359 | |
| — | GPT-4o Transcribe | OpenAI | 742 ms | — | 29,359 | |
| — | Grok STT | xAI | 199 ms | — | 29,363 | |
| — | resonant-1 | Reson8 | 288 ms | — | 17,091 |
Tail latency
The distribution behind each average, ranked by median TTFT.
- Nova 2p50 1005 ms · p99 3007 ms
- Nova 3p50 1010 ms · p99 2990 ms
- Universal 3.5 Prop50 1117 ms · p99 2918 ms
- Fluxp50 1171 ms · p99 2897 ms
- Flux Multilingualp50 1201 ms · p99 2912 ms
- Whisper Large v3p50 1320 ms · p99 3480 ms
- Parakeet TDT 0.6B v3p50 1337 ms · p99 3042 ms
- Nemotron 3.5 ASR Streamingp50 1467 ms · p99 3951 ms
- Universal Streamingp50 1481 ms · p99 3261 ms
- STT 1p50 1489 ms · p99 2635 ms
- Defaultvia Speechmaticsp50 1533 ms · p99 3279 ms
- STT RT v5p50 1555 ms · p99 3259 ms
- Enhancedp50 1565 ms · p99 3063 ms
- Velma 2 STT Streamingp50 1573 ms · p99 3380 ms
- Solaria 1p50 1598 ms · p99 6630 ms
- Defaultvia Azurep50 1754 ms · p99 3356 ms
- Ink 2p50 1773 ms · p99 3558 ms
- Voxtral Mini Transcribe Realtime 2602p50 1835 ms · p99 3734 ms
- GPT Realtime Whisperp50 1842 ms · p99 3632 ms
- Defaultvia Gradiump50 1965 ms · p99 3741 ms
- Scribe v2 Realtimep50 2112 ms · p99 3226 ms
- Pulsep50 2291 ms · p99 3518 ms
- Chirp 3p50 6370 ms · p99 9047 ms
- Chirp 2p50 6385 ms · p99 8905 ms
Last 30 days
Daily median for the current top 5 · gaps are days without qualifying runs.
Time to First Token by dataset
The overall average split by test condition — where each model holds up and where it degrades.
| # | Model | Host | All datasets | WildASR clean | PipeCat (production) | WildASR accents | WildASR clipping | WildASR far-field | WildASR noise gaps | WildASR phone codec | WildASR reverb |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Universal 3.5 Pro | AssemblyAI | 1030 ms | 899 ms | 1181 ms | 464 ms | 927 ms | 959 ms | 916 ms | 956 ms | 923 ms |
| 2 | Flux | Deepgram | 1089 ms | 931 ms | 1281 ms | 703 ms | 838 ms | 828 ms | 930 ms | 1044 ms | 826 ms |
| 3 | Flux Multilingual | Deepgram | 1175 ms | 1008 ms | 1348 ms | 477 ms | 1216 ms | 1103 ms | 1021 ms | 1035 ms | 1075 ms |
| 4 | Parakeet TDT 0.6B v3 | Together AI | 1210 ms | 1111 ms | 1365 ms | 489 ms | 1088 ms | 1112 ms | 1135 ms | 1133 ms | 1099 ms |
| 5 | Whisper Large v3 | Together AI | 1241 ms | 1150 ms | 1399 ms | 452 ms | 1104 ms | 1144 ms | 1162 ms | 1173 ms | 1146 ms |
| 6 | Nova 3 | Deepgram | 1434 ms | 1225 ms | 1641 ms | 989 ms | 1289 ms | 1268 ms | 1242 ms | 1236 ms | 1263 ms |
| 7 | Nova 2 | Deepgram | 1436 ms | 1211 ms | 1631 ms | 1024 ms | 1416 ms | 1301 ms | 1230 ms | 1267 ms | 1264 ms |
| 8 | STT 1 | Inworld AI | 1468 ms | 1432 ms | 1534 ms | 1073 ms | 1328 ms | 1454 ms | 1436 ms | 1552 ms | 1415 ms |
| 9 | Default | Speechmatics | 1473 ms | 1393 ms | 1575 ms | 715 ms | 1540 ms | 1492 ms | 1436 ms | 1448 ms | 1462 ms |
| 10 | Universal Streaming | AssemblyAI | 1510 ms | 1376 ms | 1616 ms | 866 ms | 1661 ms | 1560 ms | 1418 ms | 1517 ms | 1469 ms |
| 11 | STT RT v5 | Soniox | 1533 ms | 1447 ms | 1655 ms | 817 ms | 1569 ms | 1514 ms | 1469 ms | 1455 ms | 1457 ms |
| 12 | Enhanced | Speechmatics | 1536 ms | 1467 ms | 1635 ms | 861 ms | 1562 ms | 1555 ms | 1486 ms | 1498 ms | 1502 ms |
| 13 | Nemotron 3.5 ASR Streaming | Together AI | 1540 ms | 1378 ms | 1648 ms | 937 ms | 1900 ms | 1588 ms | 1432 ms | 1408 ms | 1499 ms |
| 14 | Velma 2 STT Streaming | Modulate | 1576 ms | 1491 ms | 1697 ms | 868 ms | 1591 ms | 1542 ms | 1504 ms | 1478 ms | 1523 ms |
| 15 | Solaria 1 | Gladia | 1703 ms | 1568 ms | 1839 ms | 1017 ms | 1749 ms | 1618 ms | 1642 ms | 1680 ms | 1611 ms |
| 16 | Default | Azure | 1792 ms | 1702 ms | 1860 ms | 1094 ms | 2051 ms | 1880 ms | 1787 ms | 1828 ms | 1784 ms |
| 17 | Ink 2 | Cartesia | 1812 ms | 1763 ms | 1921 ms | 1024 ms | 1790 ms | 1814 ms | 1778 ms | 1764 ms | 1774 ms |
| 18 | GPT Realtime Whisper | OpenAI | 1823 ms | 1767 ms | 1923 ms | 1043 ms | 1845 ms | 1855 ms | 1781 ms | 1790 ms | 1815 ms |
| 19 | Voxtral Mini Transcribe Realtime 2602 | Mistral | 1828 ms | 1774 ms | 1937 ms | 1050 ms | 1806 ms | 1819 ms | 1795 ms | 1792 ms | 1802 ms |
| 20 | Default | Gradium | 1979 ms | 1926 ms | 2094 ms | 1262 ms | 1882 ms | 1923 ms | 1953 ms | 1936 ms | 1931 ms |
| 21 | Pulse | Smallest | 2072 ms | 1933 ms | 2211 ms | 1337 ms | 2175 ms | 2121 ms | 1945 ms | 2006 ms | 1954 ms |
| 22 | Scribe v2 Realtime | ElevenLabs | 2157 ms | 2114 ms | 2199 ms | 2073 ms | 2140 ms | 2125 ms | 2119 ms | 2114 ms | 2117 ms |
| 23 | Chirp 3 | 5999 ms | 6215 ms | 5934 ms | 4451 ms | 6381 ms | 6301 ms | 6293 ms | 6392 ms | 5977 ms | |
| 24 | Chirp 2 | 6000 ms | 6211 ms | 5933 ms | 4455 ms | 6397 ms | 6317 ms | 6324 ms | 6377 ms | 5970 ms |
About TTFT
Why it matters
Partial transcripts support live captions and allow an application to begin processing speech before the turn is complete. TTFT measures when the first partial transcript arrives.
TTFT should be read with Time to Final Segment because an early partial transcript does not guarantee an early final transcript.
How Coval measures it
The same audio runs against every model daily, with connection setup (TCP, TLS, handshakes) excluded the same way for everyone.
Some providers emit partial transcripts on a fixed schedule rather than as soon as text is available. Those endpoints are excluded from TTFT rankings because the result would primarily reflect the emission interval; their other metrics remain available.
Caveats and interpretation
- Providers that emit partials on a fixed schedule can expose their event cadence as much as model computation time.
- A fast first token does not guarantee a fast or stable final transcript, so TTFT should be read beside TTFS and WER.
The datasets behind it
Every model runs the same fixed inputs, so a gap in TTFT is the model's doing — not the test's.
Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.
Evaluate your own voice agent
Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.