BENCHMARKSTT28 MODELS RANKEDLAST 30 DAYS
Time to Final Segment (TTFS)
Time to Final Segment (TTFS) is how long a speech-to-text model takes to deliver its final transcript after the speaker stops talking.
- Current STT leaderDedicated inference. Shared endpoints serve many customers on the same infrastructure, while dedicated endpoints run on hardware reserved for a single customer.#1 / 28
- 39ms
- Qwen3 ASR 1.7bvia Baseten
How it is calculated
TTFS = final-transcript timestamp − shared end-of-speech timestamp.
How to read it
- Unit
- ms
- Better
- Lower
- Period
- Rolling 30 days
- Cadence
- Re-measured daily
Speech-to-Text models on Time to Final Segment
Full STT dashboard- #1Qwen3 ASR 1.7bDedicated inference. Shared endpoints serve many customers on the same infrastructure, while dedicated endpoints run on hardware reserved for a single customer.39 ms
- #11Whisper Large v3via BasetenDedicated inference. Shared endpoints serve many customers on the same infrastructure, while dedicated endpoints run on hardware reserved for a single customer.125 ms
Show all 28 modelsShow fewer
- #15Defaultvia Speechmatics209 ms
- #17Defaultvia Gradium246 ms
| # | Model | Host | TTFS | WER | TTFT | Samples |
|---|---|---|---|---|---|---|
| 1 | Qwen3 ASR 1.7b | Baseten | 39 ms | 931 ms | 1,256 | |
| 2 | Qwen3 ASR Fast | Nari | 46 ms | 1748 ms | 4,451 | |
| 3 | STT RT v5 | Soniox | 57 ms | 1529 ms | 22,468 | |
| 4 | STT 1 | Inworld AI | 65 ms | 1400 ms | 22,836 | |
| 5 | Parakeet TDT 0.6B v3 | Together AI | 81 ms | 1215 ms | 22,488 | |
| 6 | Nova 3 | Deepgram | 89 ms | 1419 ms | 22,855 | |
| 7 | Nova 2 | Deepgram | 92 ms | 1420 ms | 22,733 | |
| 8 | Flux Multilingual | Deepgram | 98 ms | 1164 ms | 12,251 | |
| 9 | Flux | Deepgram | 99 ms | 1076 ms | 12,243 | |
| 10 | Ink 2 | Cartesia | 122 ms | 1827 ms | 22,862 | |
| 11 | Whisper Large v3 | Baseten | 125 ms | 912 ms | 1,252 | |
| 12 | Scribe v2 Realtime | ElevenLabs | 133 ms | 2175 ms | 22,866 | |
| 13 | Universal 3.5 Pro | AssemblyAI | 173 ms | 1041 ms | 20,253 | |
| 14 | Grok STT | xAI | 207 ms | — | 22,853 | |
| 15 | Default | Speechmatics | 209 ms | 1428 ms | 22,876 | |
| 16 | Pulse | Smallest | 212 ms | 2011 ms | 22,856 | |
| 17 | Default | Gradium | 246 ms | 1980 ms | 22,839 | |
| 18 | resonant-1 | Reson8 | 264 ms | — | 22,860 | |
| 19 | Whisper Large v3 | Together AI | 295 ms | 1338 ms | 22,744 | |
| 20 | Enhanced | Speechmatics | 299 ms | 1492 ms | 22,876 | |
| 21 | Gemini 3.5 Transcribe Live | Gemini | 305 ms | 1679 ms | 16,403 | |
| 22 | Voxtral Mini Transcribe Realtime 2602 | Mistral | 401 ms | 1851 ms | 22,583 | |
| 23 | GPT Realtime Whisper | OpenAI | 551 ms | 1814 ms | 22,812 | |
| 24 | GPT-4o mini Transcribe | OpenAI | 690 ms | — | 22,830 | |
| 25 | GPT-4o Transcribe | OpenAI | 754 ms | — | 22,831 | |
| 26 | Chirp 3 | 776 ms | 5974 ms | 22,875 | ||
| 27 | Solaria 1 | Gladia | 805 ms | 1804 ms | 22,439 | |
| 28 | Chirp 2 | 873 ms | 6071 ms | 22,789 | ||
| — | Nemotron 3.5 ASR Streaming | Together AI | — | 1548 ms | 22,747 | |
| — | Universal Streaming | AssemblyAI | — | 1514 ms | 20,235 |
Tail latency
The distribution behind each average, ranked by median TTFS.
- Qwen3 ASR 1.7bp50 22 ms · p99 147 ms
- Qwen3 ASR Fastp50 44 ms · p99 88 ms
- STT RT v5p50 51 ms · p99 110 ms
- Parakeet TDT 0.6B v3p50 59 ms · p99 176 ms
- STT 1p50 63 ms · p99 119 ms
- Nova 3p50 92 ms · p99 173 ms
- Nova 2p50 92 ms · p99 193 ms
- Flux Multilingualp50 97 ms · p99 184 ms
- Fluxp50 97 ms · p99 190 ms
- Whisper Large v3via Basetenp50 113 ms · p99 298 ms
- Ink 2p50 119 ms · p99 186 ms
- Scribe v2 Realtimep50 126 ms · p99 291 ms
- Whisper Large v3via Together AIp50 138 ms · p99 3922 ms
- Universal 3.5 Prop50 143 ms · p99 581 ms
- Pulsep50 196 ms · p99 371 ms
- Grok STTp50 197 ms · p99 479 ms
- Defaultvia Speechmaticsp50 203 ms · p99 331 ms
- Defaultvia Gradiump50 246 ms · p99 370 ms
- resonant-1p50 264 ms · p99 324 ms
- Gemini 3.5 Transcribe Livep50 283 ms · p99 517 ms
- Enhancedp50 288 ms · p99 520 ms
- Voxtral Mini Transcribe Realtime 2602p50 329 ms · p99 1598 ms
- Solaria 1p50 411 ms · p99 7730 ms
- GPT Realtime Whisperp50 553 ms · p99 847 ms
- GPT-4o mini Transcribep50 652 ms · p99 1424 ms
- GPT-4o Transcribep50 725 ms · p99 1374 ms
- Chirp 3p50 771 ms · p99 1182 ms
- Chirp 2p50 791 ms · p99 2171 ms
Last 30 days
Daily median for the current top 5 · gaps are days without qualifying runs.
Time to Final Segment by dataset
The overall average split by test condition — where each model holds up and where it degrades.
| # | Model | Host | All datasets | WildASR clean | PipeCat (production) | WildASR accents | WildASR clipping | WildASR far-field | WildASR noise gaps | WildASR phone codec | WildASR reverb |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 1 | Qwen3 ASR 1.7b | Baseten | 39 ms | 32 ms | 30 ms | 22 ms | 101 ms | 83 ms | 30 ms | 23 ms | 93 ms |
| 2 | Qwen3 ASR Fast | Nari | 46 ms | 46 ms | 47 ms | 43 ms | 46 ms | 45 ms | 44 ms | 44 ms | 45 ms |
| 3 | STT RT v5 | Soniox | 57 ms | 57 ms | 58 ms | 58 ms | 56 ms | 54 ms | 56 ms | 59 ms | 57 ms |
| 4 | STT 1 | Inworld AI | 65 ms | 68 ms | 63 ms | 62 ms | 71 ms | 73 ms | 71 ms | 57 ms | 65 ms |
| 5 | Parakeet TDT 0.6B v3 | Together AI | 81 ms | 79 ms | 81 ms | 86 ms | 80 ms | 79 ms | 79 ms | 81 ms | 80 ms |
| 6 | Nova 3 | Deepgram | 89 ms | 89 ms | 88 ms | 83 ms | 92 ms | 87 ms | 88 ms | 94 ms | 87 ms |
| 7 | Nova 2 | Deepgram | 92 ms | 90 ms | 91 ms | 90 ms | 87 ms | 126 ms | 87 ms | 93 ms | 86 ms |
| 8 | Flux Multilingual | Deepgram | 98 ms | 97 ms | 96 ms | 98 ms | 110 ms | 99 ms | 96 ms | 100 ms | 98 ms |
| 9 | Flux | Deepgram | 99 ms | 99 ms | 94 ms | 97 ms | 117 ms | 98 ms | 101 ms | 119 ms | 114 ms |
| 10 | Ink 2 | Cartesia | 122 ms | 121 ms | 122 ms | 123 ms | 123 ms | 124 ms | 120 ms | 125 ms | 125 ms |
| 11 | Whisper Large v3 | Baseten | 125 ms | 127 ms | 123 ms | 89 ms | 136 ms | 137 ms | 122 ms | 148 ms | 121 ms |
| 12 | Scribe v2 Realtime | ElevenLabs | 133 ms | 134 ms | 132 ms | 131 ms | 134 ms | 135 ms | 136 ms | 135 ms | 135 ms |
| 13 | Universal 3.5 Pro | AssemblyAI | 173 ms | 166 ms | 173 ms | 201 ms | 176 ms | 184 ms | 171 ms | 169 ms | 170 ms |
| 14 | Grok STT | xAI | 207 ms | 204 ms | 210 ms | 173 ms | 259 ms | 208 ms | 207 ms | 197 ms | 186 ms |
| 15 | Default | Speechmatics | 209 ms | 209 ms | 205 ms | 234 ms | 221 ms | 213 ms | 209 ms | 207 ms | 216 ms |
| 16 | Pulse | Smallest | 212 ms | 212 ms | 208 ms | 216 ms | 220 ms | 224 ms | 210 ms | 222 ms | 223 ms |
| 17 | Default | Gradium | 246 ms | 249 ms | 238 ms | 308 ms | 242 ms | 241 ms | 235 ms | 271 ms | 252 ms |
| 18 | resonant-1 | Reson8 | 264 ms | 265 ms | 266 ms | 247 ms | 262 ms | 264 ms | 264 ms | 262 ms | 261 ms |
| 19 | Whisper Large v3 | Together AI | 295 ms | 304 ms | 294 ms | 317 ms | 278 ms | 274 ms | 274 ms | 301 ms | 310 ms |
| 20 | Enhanced | Speechmatics | 299 ms | 298 ms | 295 ms | 324 ms | 307 ms | 303 ms | 305 ms | 298 ms | 305 ms |
| 21 | Gemini 3.5 Transcribe Live | Gemini | 305 ms | 305 ms | 308 ms | 275 ms | 302 ms | 306 ms | 303 ms | 302 ms | 303 ms |
| 22 | Voxtral Mini Transcribe Realtime 2602 | Mistral | 401 ms | 393 ms | 398 ms | 369 ms | 394 ms | 400 ms | 413 ms | 455 ms | 426 ms |
| 23 | GPT Realtime Whisper | OpenAI | 551 ms | 543 ms | 549 ms | 565 ms | 568 ms | 551 ms | 550 ms | 556 ms | 559 ms |
| 24 | GPT-4o mini Transcribe | OpenAI | 690 ms | 692 ms | 693 ms | 633 ms | 689 ms | 690 ms | 707 ms | 686 ms | 691 ms |
| 25 | GPT-4o Transcribe | OpenAI | 754 ms | 762 ms | 759 ms | 652 ms | 762 ms | 764 ms | 768 ms | 758 ms | 740 ms |
| 26 | Chirp 3 | 776 ms | 771 ms | 793 ms | 669 ms | 744 ms | 761 ms | 789 ms | 771 ms | 761 ms | |
| 27 | Solaria 1 | Gladia | 805 ms | 834 ms | 800 ms | 799 ms | 831 ms | 816 ms | 782 ms | 783 ms | 758 ms |
| 28 | Chirp 2 | 873 ms | 866 ms | 881 ms | 770 ms | 866 ms | 901 ms | 874 ms | 902 ms | 869 ms |
About TTFS
Why it matters
Applications often wait for a final transcript before acting on a completed turn. A model may stream partial text quickly but take longer to mark the segment final.
Coval uses TTFS as the primary speech-to-text ranking metric because it measures when the final transcript becomes available after speech ends.
How Coval measures it
One shared voice-activity model identifies the end of speech, and every provider's timer starts from that point. Provider-specific endpointing decisions are therefore excluded from the comparison.
Every model receives the same audio, and connection setup is excluded consistently across providers.
Caveats and interpretation
- A production agent may add its own endpointing delay before the benchmark's shared end-of-speech instant.
- Providers expose different finalization semantics; Coval uses the event treated as final by the published integration for each endpoint.
The datasets behind it
Every model runs the same fixed inputs, so a gap in TTFS is the model's doing — not the test's.
Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.
Evaluate your own voice agent
Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.