BENCHMARKSTT24 MODELS RANKEDLAST 30 DAYS

Time to Final Segment (TTFS)

Time to Final Segment (TTFS) is how long a speech-to-text model takes to deliver its final transcript after the speaker stops talking.

Current STT leader#1 / 24
64ms
STT RT v5via Soniox

How it is calculated

TTFS = final-transcript timestamp − shared end-of-speech timestamp.

How to read it

Unit
ms
Better
Lower
Period
Rolling 30 days
Cadence
Re-measured daily

Speech-to-Text models on Time to Final Segment

Full STT dashboard
Time to Final Segment — every measured STT modelMilliseconds · lower is better · 30-day averageEvery STT model ranked on Time to Final Segment.
  1. #1STT RT v564 ms
  2. #3STT 183 ms
  3. #4Nova 399 ms
  4. #5Nova 2101 ms
  5. #6Ink 2108 ms
  6. #9Defaultvia Azure155 ms
  7. #12Grok STT199 ms
Show all 24 models
  1. #13Pulse205 ms
  2. #14Defaultvia Speechmatics223 ms
  3. #15Defaultvia Gradium249 ms
  4. #16resonant-1288 ms
  5. #17Enhanced341 ms
  6. #21Solaria 1680 ms
  7. #23Chirp 2811 ms
  8. #24Chirp 3813 ms
median of all models · 202 ms
STT models over the last 30 days, ranked on Time to Final Segment.
#ModelHostTTFSWERTTFTSamples
1STT RT v5Soniox64 ms1533 ms29,322
2Parakeet TDT 0.6B v3Together AI70 ms1210 ms29,161
3STT 1Inworld AI83 ms1468 ms29,280
4Nova 3Deepgram99 ms1434 ms29,290
5Nova 2Deepgram101 ms1436 ms29,145
6Ink 2Cartesia108 ms1812 ms29,288
7Scribe v2 RealtimeElevenLabs120 ms2157 ms29,313
8Universal 3.5 ProAssemblyAI146 ms1030 ms29,280
9DefaultAzure155 ms1792 ms6,682
10Whisper Large v3Together AI180 ms1241 ms29,171
11Velma 2 STT StreamingModulate191 ms1576 ms17,895
12Grok STTxAI199 ms29,322
13PulseSmallest205 ms2072 ms29,313
14DefaultSpeechmatics223 ms1473 ms29,323
15DefaultGradium249 ms1979 ms28,235
16resonant-1Reson8288 ms17,066
17EnhancedSpeechmatics341 ms1536 ms29,322
18Voxtral Mini Transcribe Realtime 2602Mistral356 ms1828 ms29,175
19GPT Realtime WhisperOpenAI559 ms1823 ms29,286
20GPT-4o mini TranscribeOpenAI623 ms29,318
21Solaria 1Gladia680 ms1703 ms26,356
22GPT-4o TranscribeOpenAI742 ms29,318
23Chirp 2Google811 ms6000 ms29,237
24Chirp 3Google813 ms5999 ms29,319
FluxDeepgram1089 ms29,354
Flux MultilingualDeepgram1175 ms29,344
Nemotron 3.5 ASR StreamingTogether AI1540 ms29,193
Universal StreamingAssemblyAI1510 ms29,297
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Tail latency

The distribution behind each average, ranked by median TTFS.

Time to Final Segment distribution per modelMilliseconds · shared axis · last 30 daysTime to Final Segment percentile spans for every measured STT model.
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops

Last 30 days

Daily median for the current top 5 · gaps are days without qualifying runs.

Time to Final Segment — current leadersDaily p50 per model · UTC daysDaily Time to Final Segment for the current top STT models over the last 30 days.
Nova 2 · Jul 30: 97 msNova 2 · Jul 31: 96 msNova 2 · Aug 1: 89 msNova 2 · Aug 2: 95 msNova 2 · Aug 3: 98 msNova 2 · Aug 4: 100 msNova 2 · Aug 5: 101 msNova 2 · Aug 6: 100 msNova 2 · Aug 7: 99 msNova 2 · Aug 8: 95 msNova 2 · Aug 9: 93 msNova 2 · Aug 10: 96 msNova 2 · Aug 11: 110 msNova 2 · Aug 12: 111 msNova 2 · Aug 13: 95 msNova 2 · Aug 14: 101 msNova 2 · Aug 15: 89 msNova 2 · Aug 16: 94 msNova 2 · Aug 17: 98 msNova 2 · Aug 18: 94 msNova 2 · Aug 19: 98 msNova 2 · Aug 20: 100 msNova 2 · Aug 21: 97 msNova 2 · Aug 22: 92 msNova 2 · Aug 23: 92 msNova 2 · Aug 24: 106 msNova 2 · Aug 25: 103 msNova 2 · Aug 26: 89 msNova 2 · Aug 27: 95 msNova 2 · Aug 28: 82 msNova 3 · Jul 30: 99 msNova 3 · Jul 31: 88 msNova 3 · Aug 1: 94 msNova 3 · Aug 2: 88 msNova 3 · Aug 3: 97 msNova 3 · Aug 4: 95 msNova 3 · Aug 5: 101 msNova 3 · Aug 6: 99 msNova 3 · Aug 7: 98 msNova 3 · Aug 8: 94 msNova 3 · Aug 9: 97 msNova 3 · Aug 10: 94 msNova 3 · Aug 11: 101 msNova 3 · Aug 12: 106 msNova 3 · Aug 13: 98 msNova 3 · Aug 14: 100 msNova 3 · Aug 15: 87 msNova 3 · Aug 16: 92 msNova 3 · Aug 17: 96 msNova 3 · Aug 18: 97 msNova 3 · Aug 19: 92 msNova 3 · Aug 20: 99 msNova 3 · Aug 21: 94 msNova 3 · Aug 22: 92 msNova 3 · Aug 23: 91 msNova 3 · Aug 24: 99 msNova 3 · Aug 25: 97 msNova 3 · Aug 26: 95 msNova 3 · Aug 27: 93 msNova 3 · Aug 28: 57 msParakeet TDT 0.6B v3 · Jul 30: 52 msParakeet TDT 0.6B v3 · Jul 31: 42 msParakeet TDT 0.6B v3 · Aug 1: 51 msParakeet TDT 0.6B v3 · Aug 2: 44 msParakeet TDT 0.6B v3 · Aug 3: 59 msParakeet TDT 0.6B v3 · Aug 4: 59 msParakeet TDT 0.6B v3 · Aug 5: 63 msParakeet TDT 0.6B v3 · Aug 6: 66 msParakeet TDT 0.6B v3 · Aug 7: 65 msParakeet TDT 0.6B v3 · Aug 8: 65 msParakeet TDT 0.6B v3 · Aug 9: 65 msParakeet TDT 0.6B v3 · Aug 10: 64 msParakeet TDT 0.6B v3 · Aug 11: 65 msParakeet TDT 0.6B v3 · Aug 12: 78 msParakeet TDT 0.6B v3 · Aug 13: 80 msParakeet TDT 0.6B v3 · Aug 14: 79 msParakeet TDT 0.6B v3 · Aug 15: 110 msParakeet TDT 0.6B v3 · Aug 16: 45 msParakeet TDT 0.6B v3 · Aug 17: 79 msParakeet TDT 0.6B v3 · Aug 18: 78 msParakeet TDT 0.6B v3 · Aug 19: 79 msParakeet TDT 0.6B v3 · Aug 20: 47 msParakeet TDT 0.6B v3 · Aug 21: 84 msParakeet TDT 0.6B v3 · Aug 22: 117 msParakeet TDT 0.6B v3 · Aug 23: 50 msParakeet TDT 0.6B v3 · Aug 24: 88 msParakeet TDT 0.6B v3 · Aug 25: 87 msParakeet TDT 0.6B v3 · Aug 26: 81 msParakeet TDT 0.6B v3 · Aug 27: 45 msParakeet TDT 0.6B v3 · Aug 28: 80 msSTT 1 · Jul 30: 112 msSTT 1 · Jul 31: 104 msSTT 1 · Aug 1: 110 msSTT 1 · Aug 2: 103 msSTT 1 · Aug 3: 112 msSTT 1 · Aug 4: 107 msSTT 1 · Aug 5: 108 msSTT 1 · Aug 6: 107 msSTT 1 · Aug 7: 107 msSTT 1 · Aug 8: 107 msSTT 1 · Aug 9: 106 msSTT 1 · Aug 10: 111 msSTT 1 · Aug 11: 103 msSTT 1 · Aug 12: 63 msSTT 1 · Aug 13: 60 msSTT 1 · Aug 14: 60 msSTT 1 · Aug 15: 60 msSTT 1 · Aug 16: 60 msSTT 1 · Aug 17: 62 msSTT 1 · Aug 18: 62 msSTT 1 · Aug 19: 63 msSTT 1 · Aug 20: 66 msSTT 1 · Aug 21: 62 msSTT 1 · Aug 22: 60 msSTT 1 · Aug 23: 67 msSTT 1 · Aug 24: 63 msSTT 1 · Aug 25: 67 msSTT 1 · Aug 26: 59 msSTT 1 · Aug 27: 61 msSTT 1 · Aug 28: 64 msSTT RT v5 · Jul 30: 57 msSTT RT v5 · Jul 31: 62 msSTT RT v5 · Aug 1: 60 msSTT RT v5 · Aug 2: 55 msSTT RT v5 · Aug 3: 64 msSTT RT v5 · Aug 4: 62 msSTT RT v5 · Aug 5: 67 msSTT RT v5 · Aug 6: 75 msSTT RT v5 · Aug 7: 75 msSTT RT v5 · Aug 8: 63 msSTT RT v5 · Aug 9: 65 msSTT RT v5 · Aug 10: 69 msSTT RT v5 · Aug 11: 73 msSTT RT v5 · Aug 12: 76 msSTT RT v5 · Aug 13: 74 msSTT RT v5 · Aug 14: 65 msSTT RT v5 · Aug 15: 62 msSTT RT v5 · Aug 16: 62 msSTT RT v5 · Aug 17: 68 msSTT RT v5 · Aug 18: 64 msSTT RT v5 · Aug 19: 50 msSTT RT v5 · Aug 20: 49 msSTT RT v5 · Aug 21: 49 msSTT RT v5 · Aug 22: 42 msSTT RT v5 · Aug 23: 46 msSTT RT v5 · Aug 24: 54 msSTT RT v5 · Aug 25: 58 msSTT RT v5 · Aug 26: 53 msSTT RT v5 · Aug 27: 51 msSTT RT v5 · Aug 28: 49 ms
Nova 2Nova 3Parakeet TDT 0.6B v3STT 1STT RT v5

Time to Final Segment by dataset

The overall average split by test condition — where each model holds up and where it degrades.

Time to Final Segment for every STT model, per dataset, over the last 30 days.
#ModelHostAll datasetsWildASR cleanPipeCat (production)WildASR accentsWildASR clippingWildASR far-fieldWildASR noise gapsWildASR phone codecWildASR reverb
1STT RT v5Soniox64 ms66 ms64 ms66 ms62 ms61 ms62 ms61 ms63 ms
2Parakeet TDT 0.6B v3Together AI70 ms66 ms70 ms73 ms71 ms70 ms67 ms72 ms71 ms
3STT 1Inworld AI83 ms87 ms81 ms79 ms87 ms91 ms88 ms67 ms81 ms
4Nova 3Deepgram99 ms103 ms99 ms96 ms96 ms96 ms94 ms94 ms94 ms
5Nova 2Deepgram101 ms99 ms106 ms93 ms95 ms98 ms95 ms93 ms93 ms
6Ink 2Cartesia108 ms108 ms108 ms110 ms107 ms110 ms107 ms111 ms110 ms
7Scribe v2 RealtimeElevenLabs120 ms121 ms119 ms119 ms127 ms123 ms122 ms120 ms122 ms
8Universal 3.5 ProAssemblyAI146 ms140 ms145 ms173 ms147 ms151 ms145 ms143 ms147 ms
9DefaultAzure155 ms150 ms163 ms116 ms153 ms152 ms159 ms154 ms147 ms
10Whisper Large v3Together AI180 ms178 ms186 ms177 ms166 ms166 ms156 ms185 ms176 ms
11Velma 2 STT StreamingModulate191 ms170 ms200 ms180 ms184 ms182 ms194 ms191 ms205 ms
12Grok STTxAI199 ms197 ms202 ms164 ms251 ms200 ms200 ms186 ms177 ms
13PulseSmallest205 ms205 ms202 ms209 ms211 ms215 ms202 ms215 ms216 ms
14DefaultSpeechmatics223 ms221 ms220 ms244 ms234 ms228 ms223 ms223 ms231 ms
15DefaultGradium249 ms250 ms241 ms318 ms241 ms247 ms243 ms274 ms253 ms
16resonant-1Reson8288 ms286 ms293 ms262 ms283 ms286 ms288 ms285 ms283 ms
17EnhancedSpeechmatics341 ms341 ms339 ms347 ms349 ms342 ms343 ms340 ms342 ms
18Voxtral Mini Transcribe Realtime 2602Mistral356 ms353 ms353 ms346 ms362 ms359 ms354 ms382 ms369 ms
19GPT Realtime WhisperOpenAI559 ms553 ms560 ms567 ms566 ms559 ms551 ms559 ms567 ms
20GPT-4o mini TranscribeOpenAI623 ms622 ms628 ms557 ms628 ms633 ms630 ms613 ms618 ms
21Solaria 1Gladia680 ms704 ms647 ms735 ms733 ms726 ms719 ms748 ms670 ms
22GPT-4o TranscribeOpenAI742 ms744 ms751 ms638 ms743 ms741 ms750 ms743 ms737 ms
23Chirp 2Google811 ms807 ms826 ms704 ms803 ms802 ms823 ms818 ms783 ms
24Chirp 3Google813 ms817 ms829 ms699 ms778 ms790 ms798 ms833 ms794 ms
Ranked on the all-datasets average; a dash means the model was not measured on that dataset in the last 30 days. Cell shading deepens toward each column’s highest value.

About TTFS

Why it matters

Applications often wait for a final transcript before acting on a completed turn. A model may stream partial text quickly but take longer to mark the segment final.

Coval uses TTFS as the primary speech-to-text ranking metric because it measures when the final transcript becomes available after speech ends.

How Coval measures it

One shared voice-activity model identifies the end of speech, and every provider's timer starts from that point. Provider-specific endpointing decisions are therefore excluded from the comparison.

Every model receives the same audio, and connection setup is excluded consistently across providers.

Caveats and interpretation

  • A production agent may add its own endpointing delay before the benchmark's shared end-of-speech instant.
  • Providers expose different finalization semantics; Coval uses the event treated as final by the published integration for each endpoint.

The datasets behind it

Every model runs the same fixed inputs, so a gap in TTFS is the model's doing — not the test's.

Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo