BENCHMARKSTT24 MODELS RANKEDLAST 30 DAYS

Time to First Token (TTFT)

Time to First Token (TTFT) is how quickly a speech-to-text model starts streaming partial transcripts after audio is sent.

Current STT leader#1 / 24
1030ms
Universal 3.5 Provia AssemblyAI

How it is calculated

TTFT = first partial-transcript timestamp − start of the measured audio request.

How to read it

Unit
ms
Better
Lower
Period
Rolling 30 days
Cadence
Re-measured daily

Speech-to-Text models on Time to First Token

Full STT dashboard
Time to First Token — every measured STT modelMilliseconds · lower is better · 30-day averageEvery STT model ranked on Time to First Token.
  1. #2Flux1089 ms
  2. #6Nova 31434 ms
  3. #7Nova 21436 ms
  4. #8STT 11468 ms
  5. #9Defaultvia Speechmatics1473 ms
  6. #11STT RT v51533 ms
  7. #12Enhanced1536 ms
Show all 24 models
  1. #15Solaria 11703 ms
  2. #16Defaultvia Azure1792 ms
  3. #17Ink 21812 ms
  4. #20Defaultvia Gradium1979 ms
  5. #21Pulse2072 ms
  6. #23Chirp 35999 ms
  7. #24Chirp 26000 ms
median of all models · 1538 ms
STT models over the last 30 days, ranked on Time to First Token.
#ModelHostTTFSWERTTFTSamples
1Universal 3.5 ProAssemblyAI146 ms1030 ms29,317
2FluxDeepgram1089 ms29,354
3Flux MultilingualDeepgram1175 ms29,344
4Parakeet TDT 0.6B v3Together AI70 ms1210 ms29,187
5Whisper Large v3Together AI180 ms1241 ms29,133
6Nova 3Deepgram99 ms1434 ms29,335
7Nova 2Deepgram101 ms1436 ms29,310
8STT 1Inworld AI83 ms1468 ms29,321
9DefaultSpeechmatics223 ms1473 ms29,353
10Universal StreamingAssemblyAI1510 ms29,297
11STT RT v5Soniox64 ms1533 ms29,363
12EnhancedSpeechmatics341 ms1536 ms29,356
13Nemotron 3.5 ASR StreamingTogether AI1540 ms29,193
14Velma 2 STT StreamingModulate191 ms1576 ms17,919
15Solaria 1Gladia680 ms1703 ms26,391
16DefaultAzure155 ms1792 ms6,689
17Ink 2Cartesia108 ms1812 ms29,329
18GPT Realtime WhisperOpenAI559 ms1823 ms29,327
19Voxtral Mini Transcribe Realtime 2602Mistral356 ms1828 ms29,206
20DefaultGradium249 ms1979 ms28,273
21PulseSmallest205 ms2072 ms29,354
22Scribe v2 RealtimeElevenLabs120 ms2157 ms29,245
23Chirp 3Google813 ms5999 ms29,360
24Chirp 2Google811 ms6000 ms29,278
GPT-4o mini TranscribeOpenAI623 ms29,359
GPT-4o TranscribeOpenAI742 ms29,359
Grok STTxAI199 ms29,363
resonant-1Reson8288 ms17,091
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Tail latency

The distribution behind each average, ranked by median TTFT.

Time to First Token distribution per modelMilliseconds · shared axis · last 30 daysTime to First Token percentile spans for every measured STT model.
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops

Last 30 days

Daily median for the current top 5 · gaps are days without qualifying runs.

Time to First Token — current leadersDaily p50 per model · UTC daysDaily Time to First Token for the current top STT models over the last 30 days.
Flux · Jul 30: 802 msFlux · Jul 31: 998 msFlux · Aug 1: 1,211 msFlux · Aug 2: 817 msFlux · Aug 3: 1,203 msFlux · Aug 4: 1,055 msFlux · Aug 5: 1,019 msFlux · Aug 6: 1,016 msFlux · Aug 7: 828 msFlux · Aug 8: 1,219 msFlux · Aug 9: 1,013 msFlux · Aug 10: 819 msFlux · Aug 11: 1,055 msFlux · Aug 12: 1,061 msFlux · Aug 13: 811 msFlux · Aug 14: 1,200 msFlux · Aug 15: 1,008 msFlux · Aug 16: 1,051 msFlux · Aug 17: 1,212 msFlux · Aug 18: 1,011 msFlux · Aug 19: 911 msFlux · Aug 20: 1,013 msFlux · Aug 21: 1,009 msFlux · Aug 22: 1,205 msFlux · Aug 23: 993 msFlux · Aug 24: 1,090 msFlux · Aug 25: 1,057 msFlux · Aug 26: 805 msFlux · Aug 27: 1,228 msFlux · Aug 28: 1,022 msFlux Multilingual · Jul 30: 1,183 msFlux Multilingual · Jul 31: 1,468 msFlux Multilingual · Aug 1: 1,080 msFlux Multilingual · Aug 2: 980 msFlux Multilingual · Aug 3: 1,140 msFlux Multilingual · Aug 4: 1,272 msFlux Multilingual · Aug 5: 1,476 msFlux Multilingual · Aug 6: 1,010 msFlux Multilingual · Aug 7: 1,196 msFlux Multilingual · Aug 8: 1,233 msFlux Multilingual · Aug 9: 1,103 msFlux Multilingual · Aug 10: 1,229 msFlux Multilingual · Aug 11: 1,239 msFlux Multilingual · Aug 12: 1,138 msFlux Multilingual · Aug 13: 1,021 msFlux Multilingual · Aug 14: 1,115 msFlux Multilingual · Aug 15: 1,201 msFlux Multilingual · Aug 16: 1,074 msFlux Multilingual · Aug 17: 1,246 msFlux Multilingual · Aug 18: 1,012 msFlux Multilingual · Aug 19: 1,129 msFlux Multilingual · Aug 20: 1,233 msFlux Multilingual · Aug 21: 1,089 msFlux Multilingual · Aug 22: 1,218 msFlux Multilingual · Aug 23: 1,208 msFlux Multilingual · Aug 24: 1,197 msFlux Multilingual · Aug 25: 1,013 msFlux Multilingual · Aug 26: 1,106 msFlux Multilingual · Aug 27: 1,244 msFlux Multilingual · Aug 28: 1,159 msParakeet TDT 0.6B v3 · Jul 30: 1,250 msParakeet TDT 0.6B v3 · Jul 31: 1,362 msParakeet TDT 0.6B v3 · Aug 1: 1,160 msParakeet TDT 0.6B v3 · Aug 2: 1,070 msParakeet TDT 0.6B v3 · Aug 3: 1,206 msParakeet TDT 0.6B v3 · Aug 4: 1,361 msParakeet TDT 0.6B v3 · Aug 5: 1,381 msParakeet TDT 0.6B v3 · Aug 6: 1,015 msParakeet TDT 0.6B v3 · Aug 7: 1,065 msParakeet TDT 0.6B v3 · Aug 8: 1,366 msParakeet TDT 0.6B v3 · Aug 9: 877 msParakeet TDT 0.6B v3 · Aug 10: 1,170 msParakeet TDT 0.6B v3 · Aug 11: 1,123 msParakeet TDT 0.6B v3 · Aug 12: 1,212 msParakeet TDT 0.6B v3 · Aug 13: 1,258 msParakeet TDT 0.6B v3 · Aug 14: 1,259 msParakeet TDT 0.6B v3 · Aug 15: 1,245 msParakeet TDT 0.6B v3 · Aug 16: 946 msParakeet TDT 0.6B v3 · Aug 17: 1,392 msParakeet TDT 0.6B v3 · Aug 18: 1,164 msParakeet TDT 0.6B v3 · Aug 19: 1,043 msParakeet TDT 0.6B v3 · Aug 20: 1,426 msParakeet TDT 0.6B v3 · Aug 21: 1,193 msParakeet TDT 0.6B v3 · Aug 22: 1,161 msParakeet TDT 0.6B v3 · Aug 23: 1,382 msParakeet TDT 0.6B v3 · Aug 24: 1,090 msParakeet TDT 0.6B v3 · Aug 25: 1,175 msParakeet TDT 0.6B v3 · Aug 26: 1,273 msParakeet TDT 0.6B v3 · Aug 27: 1,224 msParakeet TDT 0.6B v3 · Aug 28: 1,325 msUniversal 3.5 Pro · Jul 30: 1,068 msUniversal 3.5 Pro · Jul 31: 967 msUniversal 3.5 Pro · Aug 1: 1,169 msUniversal 3.5 Pro · Aug 2: 742 msUniversal 3.5 Pro · Aug 3: 968 msUniversal 3.5 Pro · Aug 4: 1,118 msUniversal 3.5 Pro · Aug 5: 919 msUniversal 3.5 Pro · Aug 6: 922 msUniversal 3.5 Pro · Aug 7: 877 msUniversal 3.5 Pro · Aug 8: 1,117 msUniversal 3.5 Pro · Aug 9: 817 msUniversal 3.5 Pro · Aug 10: 992 msUniversal 3.5 Pro · Aug 11: 1,118 msUniversal 3.5 Pro · Aug 12: 998 msUniversal 3.5 Pro · Aug 13: 993 msUniversal 3.5 Pro · Aug 14: 818 msUniversal 3.5 Pro · Aug 15: 1,118 msUniversal 3.5 Pro · Aug 16: 942 msUniversal 3.5 Pro · Aug 17: 1,019 msUniversal 3.5 Pro · Aug 18: 1,042 msUniversal 3.5 Pro · Aug 19: 969 msUniversal 3.5 Pro · Aug 20: 1,120 msUniversal 3.5 Pro · Aug 21: 770 msUniversal 3.5 Pro · Aug 22: 1,118 msUniversal 3.5 Pro · Aug 23: 967 msUniversal 3.5 Pro · Aug 24: 1,119 msUniversal 3.5 Pro · Aug 25: 930 msUniversal 3.5 Pro · Aug 26: 968 msUniversal 3.5 Pro · Aug 27: 1,043 msUniversal 3.5 Pro · Aug 28: 1,116 msWhisper Large v3 · Jul 30: 1,286 msWhisper Large v3 · Jul 31: 1,383 msWhisper Large v3 · Aug 1: 1,184 msWhisper Large v3 · Aug 2: 879 msWhisper Large v3 · Aug 3: 1,255 msWhisper Large v3 · Aug 4: 1,387 msWhisper Large v3 · Aug 5: 1,167 msWhisper Large v3 · Aug 6: 1,138 msWhisper Large v3 · Aug 7: 1,059 msWhisper Large v3 · Aug 8: 1,382 msWhisper Large v3 · Aug 9: 880 msWhisper Large v3 · Aug 10: 1,392 msWhisper Large v3 · Aug 11: 1,103 msWhisper Large v3 · Aug 12: 1,247 msWhisper Large v3 · Aug 13: 1,303 msWhisper Large v3 · Aug 14: 1,251 msWhisper Large v3 · Aug 15: 1,282 msWhisper Large v3 · Aug 16: 875 msWhisper Large v3 · Aug 17: 1,403 msWhisper Large v3 · Aug 18: 886 msWhisper Large v3 · Aug 19: 1,273 msWhisper Large v3 · Aug 20: 1,448 msWhisper Large v3 · Aug 21: 984 msWhisper Large v3 · Aug 22: 1,383 msWhisper Large v3 · Aug 23: 1,387 msWhisper Large v3 · Aug 24: 1,230 msWhisper Large v3 · Aug 25: 1,249 msWhisper Large v3 · Aug 26: 1,270 msWhisper Large v3 · Aug 27: 1,329 msWhisper Large v3 · Aug 28: 1,341 ms
FluxFlux MultilingualParakeet TDT 0.6B v3Universal 3.5 ProWhisper Large v3

Time to First Token by dataset

The overall average split by test condition — where each model holds up and where it degrades.

Time to First Token for every STT model, per dataset, over the last 30 days.
#ModelHostAll datasetsWildASR cleanPipeCat (production)WildASR accentsWildASR clippingWildASR far-fieldWildASR noise gapsWildASR phone codecWildASR reverb
1Universal 3.5 ProAssemblyAI1030 ms899 ms1181 ms464 ms927 ms959 ms916 ms956 ms923 ms
2FluxDeepgram1089 ms931 ms1281 ms703 ms838 ms828 ms930 ms1044 ms826 ms
3Flux MultilingualDeepgram1175 ms1008 ms1348 ms477 ms1216 ms1103 ms1021 ms1035 ms1075 ms
4Parakeet TDT 0.6B v3Together AI1210 ms1111 ms1365 ms489 ms1088 ms1112 ms1135 ms1133 ms1099 ms
5Whisper Large v3Together AI1241 ms1150 ms1399 ms452 ms1104 ms1144 ms1162 ms1173 ms1146 ms
6Nova 3Deepgram1434 ms1225 ms1641 ms989 ms1289 ms1268 ms1242 ms1236 ms1263 ms
7Nova 2Deepgram1436 ms1211 ms1631 ms1024 ms1416 ms1301 ms1230 ms1267 ms1264 ms
8STT 1Inworld AI1468 ms1432 ms1534 ms1073 ms1328 ms1454 ms1436 ms1552 ms1415 ms
9DefaultSpeechmatics1473 ms1393 ms1575 ms715 ms1540 ms1492 ms1436 ms1448 ms1462 ms
10Universal StreamingAssemblyAI1510 ms1376 ms1616 ms866 ms1661 ms1560 ms1418 ms1517 ms1469 ms
11STT RT v5Soniox1533 ms1447 ms1655 ms817 ms1569 ms1514 ms1469 ms1455 ms1457 ms
12EnhancedSpeechmatics1536 ms1467 ms1635 ms861 ms1562 ms1555 ms1486 ms1498 ms1502 ms
13Nemotron 3.5 ASR StreamingTogether AI1540 ms1378 ms1648 ms937 ms1900 ms1588 ms1432 ms1408 ms1499 ms
14Velma 2 STT StreamingModulate1576 ms1491 ms1697 ms868 ms1591 ms1542 ms1504 ms1478 ms1523 ms
15Solaria 1Gladia1703 ms1568 ms1839 ms1017 ms1749 ms1618 ms1642 ms1680 ms1611 ms
16DefaultAzure1792 ms1702 ms1860 ms1094 ms2051 ms1880 ms1787 ms1828 ms1784 ms
17Ink 2Cartesia1812 ms1763 ms1921 ms1024 ms1790 ms1814 ms1778 ms1764 ms1774 ms
18GPT Realtime WhisperOpenAI1823 ms1767 ms1923 ms1043 ms1845 ms1855 ms1781 ms1790 ms1815 ms
19Voxtral Mini Transcribe Realtime 2602Mistral1828 ms1774 ms1937 ms1050 ms1806 ms1819 ms1795 ms1792 ms1802 ms
20DefaultGradium1979 ms1926 ms2094 ms1262 ms1882 ms1923 ms1953 ms1936 ms1931 ms
21PulseSmallest2072 ms1933 ms2211 ms1337 ms2175 ms2121 ms1945 ms2006 ms1954 ms
22Scribe v2 RealtimeElevenLabs2157 ms2114 ms2199 ms2073 ms2140 ms2125 ms2119 ms2114 ms2117 ms
23Chirp 3Google5999 ms6215 ms5934 ms4451 ms6381 ms6301 ms6293 ms6392 ms5977 ms
24Chirp 2Google6000 ms6211 ms5933 ms4455 ms6397 ms6317 ms6324 ms6377 ms5970 ms
Ranked on the all-datasets average; a dash means the model was not measured on that dataset in the last 30 days. Cell shading deepens toward each column’s highest value.

About TTFT

Why it matters

Partial transcripts support live captions and allow an application to begin processing speech before the turn is complete. TTFT measures when the first partial transcript arrives.

TTFT should be read with Time to Final Segment because an early partial transcript does not guarantee an early final transcript.

How Coval measures it

The same audio runs against every model daily, with connection setup (TCP, TLS, handshakes) excluded the same way for everyone.

Some providers emit partial transcripts on a fixed schedule rather than as soon as text is available. Those endpoints are excluded from TTFT rankings because the result would primarily reflect the emission interval; their other metrics remain available.

Caveats and interpretation

  • Providers that emit partials on a fixed schedule can expose their event cadence as much as model computation time.
  • A fast first token does not guarantee a fast or stable final transcript, so TTFT should be read beside TTFS and WER.

The datasets behind it

Every model runs the same fixed inputs, so a gap in TTFT is the model's doing — not the test's.

Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo