BENCHMARKSTT28 MODELS RANKEDLAST 30 DAYS

Time to Final Segment (TTFS)

Time to Final Segment (TTFS) is how long a speech-to-text model takes to deliver its final transcript after the speaker stops talking.

Current STT leader#1 / 28
39ms
Qwen3 ASR 1.7bvia Baseten

How it is calculated

TTFS = final-transcript timestamp − shared end-of-speech timestamp.

How to read it

Unit
ms
Better
Lower
Period
Rolling 30 days
Cadence
Re-measured daily

Speech-to-Text models on Time to Final Segment

Full STT dashboard
Time to Final Segment — every measured STT modelMilliseconds · lower is better · 30-day averageEvery STT model ranked on Time to Final Segment.
  1. #1Qwen3 ASR 1.7b39 ms
  2. #3STT RT v557 ms
  3. #4STT 165 ms
  4. #6Nova 389 ms
  5. #7Nova 292 ms
  6. #9Flux99 ms
  7. #10Ink 2122 ms
  8. #11Whisper Large v3via Baseten125 ms
Show all 28 models
  1. #14Grok STT207 ms
  2. #15Defaultvia Speechmatics209 ms
  3. #16Pulse212 ms
  4. #17Defaultvia Gradium246 ms
  5. #18resonant-1264 ms
  6. #19Whisper Large v3via Together AI295 ms
  7. #20Enhanced299 ms
  8. #26Chirp 3776 ms
  9. #27Solaria 1805 ms
  10. #28Chirp 2873 ms
median of all models · 208 ms
STT models over the last 30 days, ranked on Time to Final Segment.
#ModelHostTTFSWERTTFTSamples
1Qwen3 ASR 1.7bBaseten39 ms931 ms1,256
2Qwen3 ASR FastNari46 ms1748 ms4,451
3STT RT v5Soniox57 ms1529 ms22,468
4STT 1Inworld AI65 ms1400 ms22,836
5Parakeet TDT 0.6B v3Together AI81 ms1215 ms22,488
6Nova 3Deepgram89 ms1419 ms22,855
7Nova 2Deepgram92 ms1420 ms22,733
8Flux MultilingualDeepgram98 ms1164 ms12,251
9FluxDeepgram99 ms1076 ms12,243
10Ink 2Cartesia122 ms1827 ms22,862
11Whisper Large v3Baseten125 ms912 ms1,252
12Scribe v2 RealtimeElevenLabs133 ms2175 ms22,866
13Universal 3.5 ProAssemblyAI173 ms1041 ms20,253
14Grok STTxAI207 ms22,853
15DefaultSpeechmatics209 ms1428 ms22,876
16PulseSmallest212 ms2011 ms22,856
17DefaultGradium246 ms1980 ms22,839
18resonant-1Reson8264 ms22,860
19Whisper Large v3Together AI295 ms1338 ms22,744
20EnhancedSpeechmatics299 ms1492 ms22,876
21Gemini 3.5 Transcribe LiveGemini305 ms1679 ms16,403
22Voxtral Mini Transcribe Realtime 2602Mistral401 ms1851 ms22,583
23GPT Realtime WhisperOpenAI551 ms1814 ms22,812
24GPT-4o mini TranscribeOpenAI690 ms22,830
25GPT-4o TranscribeOpenAI754 ms22,831
26Chirp 3Google776 ms5974 ms22,875
27Solaria 1Gladia805 ms1804 ms22,439
28Chirp 2Google873 ms6071 ms22,789
Nemotron 3.5 ASR StreamingTogether AI1548 ms22,747
Universal StreamingAssemblyAI1514 ms20,235
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Tail latency

The distribution behind each average, ranked by median TTFS.

Time to Final Segment distribution per modelMilliseconds · shared axis · last 30 daysTime to Final Segment percentile spans for every measured STT model.
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops

Last 30 days

Daily median for the current top 5 · gaps are days without qualifying runs.

Time to Final Segment — current leadersDaily p50 per model · UTC daysDaily Time to Final Segment for the current top STT models over the last 30 days.
Parakeet TDT 0.6B v3 · Sep 1: 48 msParakeet TDT 0.6B v3 · Sep 2: 74 msParakeet TDT 0.6B v3 · Sep 3: 52 msParakeet TDT 0.6B v3 · Sep 4: 86 msParakeet TDT 0.6B v3 · Sep 5: 76 msParakeet TDT 0.6B v3 · Sep 6: 60 msParakeet TDT 0.6B v3 · Sep 7: 53 msParakeet TDT 0.6B v3 · Sep 8: 81 msParakeet TDT 0.6B v3 · Sep 9: 67 msParakeet TDT 0.6B v3 · Sep 10: 51 msParakeet TDT 0.6B v3 · Sep 11: 45 msParakeet TDT 0.6B v3 · Sep 12: 69 msParakeet TDT 0.6B v3 · Sep 13: 75 msParakeet TDT 0.6B v3 · Sep 14: 87 msParakeet TDT 0.6B v3 · Sep 15: 48 msQwen3 ASR 1.7b · Sep 2: 22 msQwen3 ASR 1.7b · Sep 3: 22 msQwen3 ASR 1.7b · Sep 4: 22 msQwen3 ASR 1.7b · Sep 5: 22 msQwen3 ASR 1.7b · Sep 6: 22 msQwen3 ASR 1.7b · Sep 7: 22 msQwen3 ASR 1.7b · Sep 8: 22 msQwen3 ASR 1.7b · Sep 9: 22 msQwen3 ASR 1.7b · Sep 10: 22 msQwen3 ASR 1.7b · Sep 11: 22 msQwen3 ASR 1.7b · Sep 12: 22 msQwen3 ASR 1.7b · Sep 13: 22 msQwen3 ASR 1.7b · Sep 14: 22 msQwen3 ASR 1.7b · Sep 15: 23 msQwen3 ASR Fast · Sep 10: 42 msQwen3 ASR Fast · Sep 11: 43 msQwen3 ASR Fast · Sep 12: 44 msQwen3 ASR Fast · Sep 13: 45 msQwen3 ASR Fast · Sep 14: 44 msQwen3 ASR Fast · Sep 15: 44 msSTT 1 · Sep 1: 66 msSTT 1 · Sep 2: 64 msSTT 1 · Sep 3: 64 msSTT 1 · Sep 4: 63 msSTT 1 · Sep 5: 62 msSTT 1 · Sep 6: 63 msSTT 1 · Sep 7: 61 msSTT 1 · Sep 8: 63 msSTT 1 · Sep 9: 64 msSTT 1 · Sep 10: 63 msSTT 1 · Sep 11: 63 msSTT 1 · Sep 12: 63 msSTT 1 · Sep 13: 64 msSTT 1 · Sep 14: 63 msSTT 1 · Sep 15: 61 msSTT RT v5 · Sep 1: 48 msSTT RT v5 · Sep 2: 54 msSTT RT v5 · Sep 3: 55 msSTT RT v5 · Sep 4: 53 msSTT RT v5 · Sep 5: 47 msSTT RT v5 · Sep 6: 46 msSTT RT v5 · Sep 7: 51 msSTT RT v5 · Sep 8: 52 msSTT RT v5 · Sep 9: 55 msSTT RT v5 · Sep 10: 55 msSTT RT v5 · Sep 11: 55 msSTT RT v5 · Sep 12: 49 msSTT RT v5 · Sep 13: 51 msSTT RT v5 · Sep 14: 58 ms
Parakeet TDT 0.6B v3Qwen3 ASR 1.7bQwen3 ASR FastSTT 1STT RT v5

Time to Final Segment by dataset

The overall average split by test condition — where each model holds up and where it degrades.

Time to Final Segment for every STT model, per dataset, over the last 30 days.
#ModelHostAll datasetsWildASR cleanPipeCat (production)WildASR accentsWildASR clippingWildASR far-fieldWildASR noise gapsWildASR phone codecWildASR reverb
1Qwen3 ASR 1.7bBaseten39 ms32 ms30 ms22 ms101 ms83 ms30 ms23 ms93 ms
2Qwen3 ASR FastNari46 ms46 ms47 ms43 ms46 ms45 ms44 ms44 ms45 ms
3STT RT v5Soniox57 ms57 ms58 ms58 ms56 ms54 ms56 ms59 ms57 ms
4STT 1Inworld AI65 ms68 ms63 ms62 ms71 ms73 ms71 ms57 ms65 ms
5Parakeet TDT 0.6B v3Together AI81 ms79 ms81 ms86 ms80 ms79 ms79 ms81 ms80 ms
6Nova 3Deepgram89 ms89 ms88 ms83 ms92 ms87 ms88 ms94 ms87 ms
7Nova 2Deepgram92 ms90 ms91 ms90 ms87 ms126 ms87 ms93 ms86 ms
8Flux MultilingualDeepgram98 ms97 ms96 ms98 ms110 ms99 ms96 ms100 ms98 ms
9FluxDeepgram99 ms99 ms94 ms97 ms117 ms98 ms101 ms119 ms114 ms
10Ink 2Cartesia122 ms121 ms122 ms123 ms123 ms124 ms120 ms125 ms125 ms
11Whisper Large v3Baseten125 ms127 ms123 ms89 ms136 ms137 ms122 ms148 ms121 ms
12Scribe v2 RealtimeElevenLabs133 ms134 ms132 ms131 ms134 ms135 ms136 ms135 ms135 ms
13Universal 3.5 ProAssemblyAI173 ms166 ms173 ms201 ms176 ms184 ms171 ms169 ms170 ms
14Grok STTxAI207 ms204 ms210 ms173 ms259 ms208 ms207 ms197 ms186 ms
15DefaultSpeechmatics209 ms209 ms205 ms234 ms221 ms213 ms209 ms207 ms216 ms
16PulseSmallest212 ms212 ms208 ms216 ms220 ms224 ms210 ms222 ms223 ms
17DefaultGradium246 ms249 ms238 ms308 ms242 ms241 ms235 ms271 ms252 ms
18resonant-1Reson8264 ms265 ms266 ms247 ms262 ms264 ms264 ms262 ms261 ms
19Whisper Large v3Together AI295 ms304 ms294 ms317 ms278 ms274 ms274 ms301 ms310 ms
20EnhancedSpeechmatics299 ms298 ms295 ms324 ms307 ms303 ms305 ms298 ms305 ms
21Gemini 3.5 Transcribe LiveGemini305 ms305 ms308 ms275 ms302 ms306 ms303 ms302 ms303 ms
22Voxtral Mini Transcribe Realtime 2602Mistral401 ms393 ms398 ms369 ms394 ms400 ms413 ms455 ms426 ms
23GPT Realtime WhisperOpenAI551 ms543 ms549 ms565 ms568 ms551 ms550 ms556 ms559 ms
24GPT-4o mini TranscribeOpenAI690 ms692 ms693 ms633 ms689 ms690 ms707 ms686 ms691 ms
25GPT-4o TranscribeOpenAI754 ms762 ms759 ms652 ms762 ms764 ms768 ms758 ms740 ms
26Chirp 3Google776 ms771 ms793 ms669 ms744 ms761 ms789 ms771 ms761 ms
27Solaria 1Gladia805 ms834 ms800 ms799 ms831 ms816 ms782 ms783 ms758 ms
28Chirp 2Google873 ms866 ms881 ms770 ms866 ms901 ms874 ms902 ms869 ms
Ranked on the all-datasets average; a dash means the model was not measured on that dataset in the last 30 days. Cell shading deepens toward each column’s highest value.

About TTFS

Why it matters

Applications often wait for a final transcript before acting on a completed turn. A model may stream partial text quickly but take longer to mark the segment final.

Coval uses TTFS as the primary speech-to-text ranking metric because it measures when the final transcript becomes available after speech ends.

How Coval measures it

One shared voice-activity model identifies the end of speech, and every provider's timer starts from that point. Provider-specific endpointing decisions are therefore excluded from the comparison.

Every model receives the same audio, and connection setup is excluded consistently across providers.

Caveats and interpretation

  • A production agent may add its own endpointing delay before the benchmark's shared end-of-speech instant.
  • Providers expose different finalization semantics; Coval uses the event treated as final by the published integration for each endpoint.

The datasets behind it

Every model runs the same fixed inputs, so a gap in TTFS is the model's doing — not the test's.

Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo