BENCHMARKSTT26 MODELS RANKEDLAST 30 DAYS
Time to First Token (TTFT)
Time to First Token (TTFT) is how quickly a speech-to-text model starts streaming partial transcripts after audio is sent.
- Current STT leaderDedicated inference. Shared endpoints serve many customers on the same infrastructure, while dedicated endpoints run on hardware reserved for a single customer.#1 / 26
- 912ms
- Whisper Large v3via Baseten
How it is calculated
TTFT = first partial-transcript timestamp − start of the measured audio request.
How to read it
- Unit
- ms
- Better
- Lower
- Period
- Rolling 30 days
- Cadence
- Re-measured daily
Speech-to-Text models on Time to First Token
Full STT dashboard- #1Whisper Large v3via BasetenDedicated inference. Shared endpoints serve many customers on the same infrastructure, while dedicated endpoints run on hardware reserved for a single customer.912 ms
- #2Qwen3 ASR 1.7bDedicated inference. Shared endpoints serve many customers on the same infrastructure, while dedicated endpoints run on hardware reserved for a single customer.931 ms
- #11Defaultvia Speechmatics1428 ms
Show all 26 modelsShow fewer
- #22Defaultvia Gradium1980 ms
| # | Model | Host | TTFS | WER | TTFT | Samples |
|---|---|---|---|---|---|---|
| 1 | Whisper Large v3 | Baseten | 125 ms | 912 ms | 1,256 | |
| 2 | Qwen3 ASR 1.7b | Baseten | 39 ms | 931 ms | 1,259 | |
| 3 | Universal 3.5 Pro | AssemblyAI | 173 ms | 1041 ms | 20,285 | |
| 4 | Flux | Deepgram | 99 ms | 1076 ms | 22,899 | |
| 5 | Flux Multilingual | Deepgram | 98 ms | 1164 ms | 22,845 | |
| 6 | Parakeet TDT 0.6B v3 | Together AI | 81 ms | 1215 ms | 22,509 | |
| 7 | Whisper Large v3 | Together AI | 295 ms | 1338 ms | 22,578 | |
| 8 | STT 1 | Inworld AI | 65 ms | 1400 ms | 22,873 | |
| 9 | Nova 3 | Deepgram | 89 ms | 1419 ms | 22,893 | |
| 10 | Nova 2 | Deepgram | 92 ms | 1420 ms | 22,864 | |
| 11 | Default | Speechmatics | 209 ms | 1428 ms | 22,907 | |
| 12 | Enhanced | Speechmatics | 299 ms | 1492 ms | 22,906 | |
| 13 | Universal Streaming | AssemblyAI | — | 1514 ms | 20,235 | |
| 14 | STT RT v5 | Soniox | 57 ms | 1529 ms | 22,504 | |
| 15 | Nemotron 3.5 ASR Streaming | Together AI | — | 1548 ms | 22,747 | |
| 16 | Gemini 3.5 Transcribe Live | Gemini | 305 ms | 1679 ms | 16,442 | |
| 17 | Qwen3 ASR Fast | Nari | 46 ms | 1748 ms | 4,461 | |
| 18 | Solaria 1 | Gladia | 805 ms | 1804 ms | 22,476 | |
| 19 | GPT Realtime Whisper | OpenAI | 551 ms | 1814 ms | 22,849 | |
| 20 | Ink 2 | Cartesia | 122 ms | 1827 ms | 22,899 | |
| 21 | Voxtral Mini Transcribe Realtime 2602 | Mistral | 401 ms | 1851 ms | 22,611 | |
| 22 | Default | Gradium | 246 ms | 1980 ms | 22,876 | |
| 23 | Pulse | Smallest | 212 ms | 2011 ms | 22,893 | |
| 24 | Scribe v2 Realtime | ElevenLabs | 133 ms | 2175 ms | 22,814 | |
| 25 | Chirp 3 | 776 ms | 5974 ms | 22,912 | ||
| 26 | Chirp 2 | 873 ms | 6071 ms | 22,826 | ||
| — | GPT-4o mini Transcribe | OpenAI | 690 ms | — | 22,867 | |
| — | GPT-4o Transcribe | OpenAI | 754 ms | — | 22,868 | |
| — | Grok STT | xAI | 207 ms | — | 22,890 | |
| — | resonant-1 | Reson8 | 264 ms | — | 22,897 |
Tail latency
The distribution behind each average, ranked by median TTFT.
- Whisper Large v3via Basetenp50 973 ms · p99 2203 ms
- Nova 2p50 993 ms · p99 2994 ms
- Nova 3p50 997 ms · p99 2985 ms
- Qwen3 ASR 1.7bp50 1055 ms · p99 2399 ms
- Universal 3.5 Prop50 1117 ms · p99 2930 ms
- Fluxp50 1160 ms · p99 2892 ms
- Flux Multilingualp50 1183 ms · p99 2895 ms
- Parakeet TDT 0.6B v3p50 1321 ms · p99 3041 ms
- Whisper Large v3via Together AIp50 1363 ms · p99 4616 ms
- STT 1p50 1435 ms · p99 2538 ms
- Nemotron 3.5 ASR Streamingp50 1474 ms · p99 3952 ms
- Universal Streamingp50 1482 ms · p99 3276 ms
- Defaultvia Speechmaticsp50 1485 ms · p99 3275 ms
- Enhancedp50 1517 ms · p99 3292 ms
- STT RT v5p50 1545 ms · p99 3333 ms
- Gemini 3.5 Transcribe Livep50 1582 ms · p99 4013 ms
- Solaria 1p50 1599 ms · p99 7910 ms
- Qwen3 ASR Fastp50 1748 ms · p99 1792 ms
- Ink 2p50 1790 ms · p99 3570 ms
- GPT Realtime Whisperp50 1837 ms · p99 3538 ms
- Voxtral Mini Transcribe Realtime 2602p50 1839 ms · p99 3749 ms
- Defaultvia Gradiump50 1964 ms · p99 3741 ms
- Scribe v2 Realtimep50 2115 ms · p99 3157 ms
- Pulsep50 2279 ms · p99 3517 ms
- Chirp 3p50 6336 ms · p99 8996 ms
- Chirp 2p50 6419 ms · p99 9103 ms
Last 30 days
Daily median for the current top 5 · gaps are days without qualifying runs.
Time to First Token by dataset
The overall average split by test condition — where each model holds up and where it degrades.
| # | Model | Host | All datasets | WildASR clean | PipeCat (production) | WildASR accents | WildASR clipping | WildASR far-field | WildASR noise gaps | WildASR phone codec | WildASR reverb |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Whisper Large v3 | Baseten | 912 ms | 850 ms | 1031 ms | 404 ms | 821 ms | 842 ms | 819 ms | 821 ms | 837 ms |
| 2 | Qwen3 ASR 1.7b | Baseten | 931 ms | 852 ms | 1061 ms | 287 ms | 868 ms | 868 ms | 813 ms | 896 ms | 864 ms |
| 3 | Universal 3.5 Pro | AssemblyAI | 1041 ms | 912 ms | 1198 ms | 471 ms | 924 ms | 963 ms | 914 ms | 954 ms | 928 ms |
| 4 | Flux | Deepgram | 1076 ms | 916 ms | 1283 ms | 691 ms | 820 ms | 786 ms | 910 ms | 1018 ms | 784 ms |
| 5 | Flux Multilingual | Deepgram | 1164 ms | 997 ms | 1343 ms | 456 ms | 1211 ms | 1089 ms | 1000 ms | 1019 ms | 1046 ms |
| 6 | Parakeet TDT 0.6B v3 | Together AI | 1215 ms | 1122 ms | 1374 ms | 493 ms | 1096 ms | 1109 ms | 1128 ms | 1118 ms | 1097 ms |
| 7 | Whisper Large v3 | Together AI | 1338 ms | 1233 ms | 1504 ms | 536 ms | 1206 ms | 1239 ms | 1265 ms | 1281 ms | 1230 ms |
| 8 | STT 1 | Inworld AI | 1400 ms | 1349 ms | 1478 ms | 1061 ms | 1278 ms | 1365 ms | 1335 ms | 1441 ms | 1324 ms |
| 9 | Nova 3 | Deepgram | 1419 ms | 1210 ms | 1645 ms | 972 ms | 1241 ms | 1229 ms | 1203 ms | 1191 ms | 1217 ms |
| 10 | Nova 2 | Deepgram | 1420 ms | 1201 ms | 1623 ms | 1019 ms | 1338 ms | 1317 ms | 1193 ms | 1222 ms | 1237 ms |
| 11 | Default | Speechmatics | 1428 ms | 1350 ms | 1543 ms | 658 ms | 1471 ms | 1423 ms | 1370 ms | 1385 ms | 1399 ms |
| 12 | Enhanced | Speechmatics | 1492 ms | 1421 ms | 1594 ms | 793 ms | 1519 ms | 1515 ms | 1435 ms | 1453 ms | 1469 ms |
| 13 | Universal Streaming | AssemblyAI | 1514 ms | 1380 ms | 1625 ms | 854 ms | 1653 ms | 1560 ms | 1423 ms | 1510 ms | 1478 ms |
| 14 | STT RT v5 | Soniox | 1529 ms | 1443 ms | 1655 ms | 807 ms | 1557 ms | 1509 ms | 1460 ms | 1444 ms | 1449 ms |
| 15 | Nemotron 3.5 ASR Streaming | Together AI | 1548 ms | 1387 ms | 1655 ms | 933 ms | 1970 ms | 1614 ms | 1419 ms | 1404 ms | 1503 ms |
| 16 | Gemini 3.5 Transcribe Live | Gemini | 1679 ms | 1626 ms | 1730 ms | 905 ms | 1885 ms | 1763 ms | 1633 ms | 1815 ms | 1746 ms |
| 17 | Qwen3 ASR Fast | Nari | 1748 ms | 1750 ms | 1750 ms | 1752 ms | 1748 ms | 1749 ms | 1752 ms | 1749 ms | 1720 ms |
| 18 | Solaria 1 | Gladia | 1804 ms | 1638 ms | 1949 ms | 1143 ms | 1806 ms | 1790 ms | 1763 ms | 1780 ms | 1723 ms |
| 19 | GPT Realtime Whisper | OpenAI | 1814 ms | 1759 ms | 1920 ms | 1037 ms | 1828 ms | 1836 ms | 1764 ms | 1759 ms | 1793 ms |
| 20 | Ink 2 | Cartesia | 1827 ms | 1775 ms | 1941 ms | 1049 ms | 1794 ms | 1824 ms | 1784 ms | 1772 ms | 1782 ms |
| 21 | Voxtral Mini Transcribe Realtime 2602 | Mistral | 1851 ms | 1793 ms | 1968 ms | 1065 ms | 1807 ms | 1817 ms | 1805 ms | 1798 ms | 1841 ms |
| 22 | Default | Gradium | 1980 ms | 1921 ms | 2103 ms | 1255 ms | 1867 ms | 1911 ms | 1944 ms | 1948 ms | 1933 ms |
| 23 | Pulse | Smallest | 2011 ms | 1846 ms | 2170 ms | 1295 ms | 2082 ms | 2040 ms | 1868 ms | 1942 ms | 1881 ms |
| 24 | Scribe v2 Realtime | ElevenLabs | 2175 ms | 2133 ms | 2218 ms | 2087 ms | 2150 ms | 2141 ms | 2140 ms | 2128 ms | 2133 ms |
| 25 | Chirp 3 | 5974 ms | 6181 ms | 5919 ms | 4372 ms | 6353 ms | 6278 ms | 6264 ms | 6308 ms | 5957 ms | |
| 26 | Chirp 2 | 6071 ms | 6288 ms | 6005 ms | 4471 ms | 6475 ms | 6420 ms | 6345 ms | 6418 ms | 6063 ms |
About TTFT
Why it matters
Partial transcripts support live captions and allow an application to begin processing speech before the turn is complete. TTFT measures when the first partial transcript arrives.
TTFT should be read with Time to Final Segment because an early partial transcript does not guarantee an early final transcript.
How Coval measures it
The same audio runs against every model daily, with connection setup (TCP, TLS, handshakes) excluded the same way for everyone.
Some providers emit partial transcripts on a fixed schedule rather than as soon as text is available. Those endpoints are excluded from TTFT rankings because the result would primarily reflect the emission interval; their other metrics remain available.
Caveats and interpretation
- Providers that emit partials on a fixed schedule can expose their event cadence as much as model computation time.
- A fast first token does not guarantee a fast or stable final transcript, so TTFT should be read beside TTFS and WER.
The datasets behind it
Every model runs the same fixed inputs, so a gap in TTFT is the model's doing — not the test's.
Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.
Evaluate your own voice agent
Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.