BENCHMARKSTT24 MODELS RANKEDLAST 30 DAYS
Time to Final Segment (TTFS)
Time to Final Segment (TTFS) is how long a speech-to-text model takes to deliver its final transcript after the speaker stops talking.
How it is calculated
TTFS = final-transcript timestamp − shared end-of-speech timestamp.
How to read it
- Unit
- ms
- Better
- Lower
- Period
- Rolling 30 days
- Cadence
- Re-measured daily
Speech-to-Text models on Time to Final Segment
Full STT dashboard- #9Defaultvia Azure155 ms
Show all 24 modelsShow fewer
- #14Defaultvia Speechmatics223 ms
- #15Defaultvia Gradium249 ms
| # | Model | Host | TTFS | WER | TTFT | Samples |
|---|---|---|---|---|---|---|
| 1 | STT RT v5 | Soniox | 64 ms | 1533 ms | 29,322 | |
| 2 | Parakeet TDT 0.6B v3 | Together AI | 70 ms | 1210 ms | 29,161 | |
| 3 | STT 1 | Inworld AI | 83 ms | 1468 ms | 29,280 | |
| 4 | Nova 3 | Deepgram | 99 ms | 1434 ms | 29,290 | |
| 5 | Nova 2 | Deepgram | 101 ms | 1436 ms | 29,145 | |
| 6 | Ink 2 | Cartesia | 108 ms | 1812 ms | 29,288 | |
| 7 | Scribe v2 Realtime | ElevenLabs | 120 ms | 2157 ms | 29,313 | |
| 8 | Universal 3.5 Pro | AssemblyAI | 146 ms | 1030 ms | 29,280 | |
| 9 | Default | Azure | 155 ms | 1792 ms | 6,682 | |
| 10 | Whisper Large v3 | Together AI | 180 ms | 1241 ms | 29,171 | |
| 11 | Velma 2 STT Streaming | Modulate | 191 ms | 1576 ms | 17,895 | |
| 12 | Grok STT | xAI | 199 ms | — | 29,322 | |
| 13 | Pulse | Smallest | 205 ms | 2072 ms | 29,313 | |
| 14 | Default | Speechmatics | 223 ms | 1473 ms | 29,323 | |
| 15 | Default | Gradium | 249 ms | 1979 ms | 28,235 | |
| 16 | resonant-1 | Reson8 | 288 ms | — | 17,066 | |
| 17 | Enhanced | Speechmatics | 341 ms | 1536 ms | 29,322 | |
| 18 | Voxtral Mini Transcribe Realtime 2602 | Mistral | 356 ms | 1828 ms | 29,175 | |
| 19 | GPT Realtime Whisper | OpenAI | 559 ms | 1823 ms | 29,286 | |
| 20 | GPT-4o mini Transcribe | OpenAI | 623 ms | — | 29,318 | |
| 21 | Solaria 1 | Gladia | 680 ms | 1703 ms | 26,356 | |
| 22 | GPT-4o Transcribe | OpenAI | 742 ms | — | 29,318 | |
| 23 | Chirp 2 | 811 ms | 6000 ms | 29,237 | ||
| 24 | Chirp 3 | 813 ms | 5999 ms | 29,319 | ||
| — | Flux | Deepgram | — | 1089 ms | 29,354 | |
| — | Flux Multilingual | Deepgram | — | 1175 ms | 29,344 | |
| — | Nemotron 3.5 ASR Streaming | Together AI | — | 1540 ms | 29,193 | |
| — | Universal Streaming | AssemblyAI | — | 1510 ms | 29,297 |
Tail latency
The distribution behind each average, ranked by median TTFS.
- STT RT v5p50 62 ms · p99 115 ms
- Parakeet TDT 0.6B v3p50 62 ms · p99 167 ms
- STT 1p50 72 ms · p99 148 ms
- Velma 2 STT Streamingp50 86 ms · p99 1644 ms
- Nova 3p50 96 ms · p99 194 ms
- Nova 2p50 96 ms · p99 217 ms
- Ink 2p50 106 ms · p99 169 ms
- Scribe v2 Realtimep50 111 ms · p99 297 ms
- Whisper Large v3p50 112 ms · p99 1641 ms
- Universal 3.5 Prop50 118 ms · p99 458 ms
- Defaultvia Azurep50 158 ms · p99 265 ms
- Pulsep50 193 ms · p99 373 ms
- Grok STTp50 193 ms · p99 336 ms
- Defaultvia Speechmaticsp50 215 ms · p99 319 ms
- Defaultvia Gradiump50 248 ms · p99 368 ms
- resonant-1p50 273 ms · p99 473 ms
- Voxtral Mini Transcribe Realtime 2602p50 310 ms · p99 1025 ms
- Enhancedp50 321 ms · p99 648 ms
- Solaria 1p50 393 ms · p99 6796 ms
- GPT Realtime Whisperp50 560 ms · p99 952 ms
- GPT-4o mini Transcribep50 578 ms · p99 1371 ms
- GPT-4o Transcribep50 714 ms · p99 1441 ms
- Chirp 2p50 767 ms · p99 1586 ms
- Chirp 3p50 789 ms · p99 1603 ms
Last 30 days
Daily median for the current top 5 · gaps are days without qualifying runs.
Time to Final Segment by dataset
The overall average split by test condition — where each model holds up and where it degrades.
| # | Model | Host | All datasets | WildASR clean | PipeCat (production) | WildASR accents | WildASR clipping | WildASR far-field | WildASR noise gaps | WildASR phone codec | WildASR reverb |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | STT RT v5 | Soniox | 64 ms | 66 ms | 64 ms | 66 ms | 62 ms | 61 ms | 62 ms | 61 ms | 63 ms |
| 2 | Parakeet TDT 0.6B v3 | Together AI | 70 ms | 66 ms | 70 ms | 73 ms | 71 ms | 70 ms | 67 ms | 72 ms | 71 ms |
| 3 | STT 1 | Inworld AI | 83 ms | 87 ms | 81 ms | 79 ms | 87 ms | 91 ms | 88 ms | 67 ms | 81 ms |
| 4 | Nova 3 | Deepgram | 99 ms | 103 ms | 99 ms | 96 ms | 96 ms | 96 ms | 94 ms | 94 ms | 94 ms |
| 5 | Nova 2 | Deepgram | 101 ms | 99 ms | 106 ms | 93 ms | 95 ms | 98 ms | 95 ms | 93 ms | 93 ms |
| 6 | Ink 2 | Cartesia | 108 ms | 108 ms | 108 ms | 110 ms | 107 ms | 110 ms | 107 ms | 111 ms | 110 ms |
| 7 | Scribe v2 Realtime | ElevenLabs | 120 ms | 121 ms | 119 ms | 119 ms | 127 ms | 123 ms | 122 ms | 120 ms | 122 ms |
| 8 | Universal 3.5 Pro | AssemblyAI | 146 ms | 140 ms | 145 ms | 173 ms | 147 ms | 151 ms | 145 ms | 143 ms | 147 ms |
| 9 | Default | Azure | 155 ms | 150 ms | 163 ms | 116 ms | 153 ms | 152 ms | 159 ms | 154 ms | 147 ms |
| 10 | Whisper Large v3 | Together AI | 180 ms | 178 ms | 186 ms | 177 ms | 166 ms | 166 ms | 156 ms | 185 ms | 176 ms |
| 11 | Velma 2 STT Streaming | Modulate | 191 ms | 170 ms | 200 ms | 180 ms | 184 ms | 182 ms | 194 ms | 191 ms | 205 ms |
| 12 | Grok STT | xAI | 199 ms | 197 ms | 202 ms | 164 ms | 251 ms | 200 ms | 200 ms | 186 ms | 177 ms |
| 13 | Pulse | Smallest | 205 ms | 205 ms | 202 ms | 209 ms | 211 ms | 215 ms | 202 ms | 215 ms | 216 ms |
| 14 | Default | Speechmatics | 223 ms | 221 ms | 220 ms | 244 ms | 234 ms | 228 ms | 223 ms | 223 ms | 231 ms |
| 15 | Default | Gradium | 249 ms | 250 ms | 241 ms | 318 ms | 241 ms | 247 ms | 243 ms | 274 ms | 253 ms |
| 16 | resonant-1 | Reson8 | 288 ms | 286 ms | 293 ms | 262 ms | 283 ms | 286 ms | 288 ms | 285 ms | 283 ms |
| 17 | Enhanced | Speechmatics | 341 ms | 341 ms | 339 ms | 347 ms | 349 ms | 342 ms | 343 ms | 340 ms | 342 ms |
| 18 | Voxtral Mini Transcribe Realtime 2602 | Mistral | 356 ms | 353 ms | 353 ms | 346 ms | 362 ms | 359 ms | 354 ms | 382 ms | 369 ms |
| 19 | GPT Realtime Whisper | OpenAI | 559 ms | 553 ms | 560 ms | 567 ms | 566 ms | 559 ms | 551 ms | 559 ms | 567 ms |
| 20 | GPT-4o mini Transcribe | OpenAI | 623 ms | 622 ms | 628 ms | 557 ms | 628 ms | 633 ms | 630 ms | 613 ms | 618 ms |
| 21 | Solaria 1 | Gladia | 680 ms | 704 ms | 647 ms | 735 ms | 733 ms | 726 ms | 719 ms | 748 ms | 670 ms |
| 22 | GPT-4o Transcribe | OpenAI | 742 ms | 744 ms | 751 ms | 638 ms | 743 ms | 741 ms | 750 ms | 743 ms | 737 ms |
| 23 | Chirp 2 | 811 ms | 807 ms | 826 ms | 704 ms | 803 ms | 802 ms | 823 ms | 818 ms | 783 ms | |
| 24 | Chirp 3 | 813 ms | 817 ms | 829 ms | 699 ms | 778 ms | 790 ms | 798 ms | 833 ms | 794 ms |
About TTFS
Why it matters
Applications often wait for a final transcript before acting on a completed turn. A model may stream partial text quickly but take longer to mark the segment final.
Coval uses TTFS as the primary speech-to-text ranking metric because it measures when the final transcript becomes available after speech ends.
How Coval measures it
One shared voice-activity model identifies the end of speech, and every provider's timer starts from that point. Provider-specific endpointing decisions are therefore excluded from the comparison.
Every model receives the same audio, and connection setup is excluded consistently across providers.
Caveats and interpretation
- A production agent may add its own endpointing delay before the benchmark's shared end-of-speech instant.
- Providers expose different finalization semantics; Coval uses the event treated as final by the published integration for each endpoint.
The datasets behind it
Every model runs the same fixed inputs, so a gap in TTFS is the model's doing — not the test's.
Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.
Evaluate your own voice agent
Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.