NVIDIASPEECH-TO-TEXT145,951 SAMPLES / 30 DAYSLAST RUN AUG 28, 2026, 21:30 UTC
Parakeet TDT 0.6B v3 speech-to-text benchmarks
Parakeet TDT 0.6B v3 is an NVIDIA open-weight speech recognition model.
- Time to Final Segment#2 / 24
- 70ms
- Word Error Rate#27 / 28
- 11%
- Time to First Token#4 / 24
- 1210ms
Overview
NVIDIA publishes the 0.6B transducer weights and model card; the tested deployment is Together shared inference.
Parakeet TDT 0.6B v3 is tested every day on fixed public audio — clean, accented, noisy, reverberant, far-field, clipped and phone-codec speech — for transcription accuracy and streaming latency.
Technical specifications
- Made by
- NVIDIA
- Hosted by
- Together AI
- Source
- Shared inference
- Licensing
- Open-weight
- Deployment
- Cloud
- Region
- US
- Features
- Multilingual
How Parakeet TDT 0.6B v3 ranks
Full STT dashboard- #9Defaultvia Azure155 ms
Show all 24 modelsShow fewer
- #14Defaultvia Speechmatics223 ms
- #15Defaultvia Gradium249 ms
- #13Defaultvia Azure5.3%
- #14Defaultvia Speechmatics5.5%
- #26Defaultvia Gradium10.0%
Show all 28 modelsShow fewer
- #9Defaultvia Speechmatics1473 ms
Show all 24 modelsShow fewer
- #16Defaultvia Azure1792 ms
- #20Defaultvia Gradium1979 ms
| # | Model | Host | TTFS | WER | TTFT | Samples |
|---|---|---|---|---|---|---|
| 1 | STT RT v5 | Soniox | 64 ms | 1533 ms | 29,322 | |
| 2 | Parakeet TDT 0.6B v3 | Together AI | 70 ms | 1210 ms | 29,161 | |
| 3 | STT 1 | Inworld AI | 83 ms | 1468 ms | 29,280 | |
| 4 | Nova 3 | Deepgram | 99 ms | 1434 ms | 29,290 | |
| 5 | Nova 2 | Deepgram | 101 ms | 1436 ms | 29,145 | |
| 6 | Ink 2 | Cartesia | 108 ms | 1812 ms | 29,288 | |
| 7 | Scribe v2 Realtime | ElevenLabs | 120 ms | 2157 ms | 29,313 | |
| 8 | Universal 3.5 Pro | AssemblyAI | 146 ms | 1030 ms | 29,280 | |
| 9 | Default | Azure | 155 ms | 1792 ms | 6,682 | |
| 10 | Whisper Large v3 | Together AI | 180 ms | 1241 ms | 29,171 | |
| 11 | Velma 2 STT Streaming | Modulate | 191 ms | 1576 ms | 17,895 | |
| 12 | Grok STT | xAI | 199 ms | — | 29,322 | |
| 13 | Pulse | Smallest | 205 ms | 2072 ms | 29,313 | |
| 14 | Default | Speechmatics | 223 ms | 1473 ms | 29,323 | |
| 15 | Default | Gradium | 249 ms | 1979 ms | 28,235 | |
| 16 | resonant-1 | Reson8 | 288 ms | — | 17,066 | |
| 17 | Enhanced | Speechmatics | 341 ms | 1536 ms | 29,322 | |
| 18 | Voxtral Mini Transcribe Realtime 2602 | Mistral | 356 ms | 1828 ms | 29,175 | |
| 19 | GPT Realtime Whisper | OpenAI | 559 ms | 1823 ms | 29,286 | |
| 20 | GPT-4o mini Transcribe | OpenAI | 623 ms | — | 29,318 | |
| 21 | Solaria 1 | Gladia | 680 ms | 1703 ms | 26,356 | |
| 22 | GPT-4o Transcribe | OpenAI | 742 ms | — | 29,318 | |
| 23 | Chirp 2 | 811 ms | 6000 ms | 29,237 | ||
| 24 | Chirp 3 | 813 ms | 5999 ms | 29,319 | ||
| — | Flux | Deepgram | — | 1089 ms | 29,354 | |
| — | Flux Multilingual | Deepgram | — | 1175 ms | 29,344 | |
| — | Nemotron 3.5 ASR Streaming | Together AI | — | 1540 ms | 29,193 | |
| — | Universal Streaming | AssemblyAI | — | 1510 ms | 29,297 |
Latency vs accuracy
Where the errors come from
- Parakeet TDT 0.6B v311.0%
Averages and tail latency
Averages hide slow outliers — these are the distributions behind each figure.
- Time to Final Segmentp50 62 ms · p99 167 ms
- Time to First Tokenp50 1337 ms · p99 3042 ms
- Parakeet TDT 0.6B v3p50 6.9% · p99 71.4%
| Metric | Average | p25 | p50 | p75 | p90 | p95 | p99 | Samples |
|---|---|---|---|---|---|---|---|---|
| Time to Final Segment | 70 ms | 42 ms | 62 ms | 113 ms | 123 ms | 129 ms | 167 ms | 29,161 |
| Word Error Rate | 11.0% | 0.0% | 6.9% | 14.3% | 27.3% | 38.1% | 71.4% | 29,201 |
| Time to First Token | 1210 ms | 841 ms | 1337 ms | 1422 ms | 1642 ms | 2028 ms | 3042 ms | 29,187 |
Last 30 days
Daily medians from the same measurement runs · gaps are days without qualifying runs.
Time to Final Segment by dataset
- WildASR clean66 ms
- WildASR noise gaps67 ms
- WildASR far-field70 ms
- PipeCat (production)70 ms
- WildASR clipping71 ms
- WildASR reverb71 ms
- WildASR phone codec72 ms
- WildASR accents73 ms
| Dataset | TTFS | Samples |
|---|---|---|
| LibriSpeech | 126 ms | 1 |
| ProductionPipeCat | 70 ms | 14,831 |
| AccentsWildASR | 73 ms | 1,436 |
| CleanWildASR | 66 ms | 5,756 |
| ClippingWildASR | 71 ms | 1,440 |
| Far-fieldWildASR | 70 ms | 1,439 |
| Noise gapsWildASR | 67 ms | 1,436 |
| Phone codecWildASR | 72 ms | 1,433 |
| ReverbWildASR | 71 ms | 1,389 |
Strongest condition: WildASR clean at 66 ms · weakest: LibriSpeech at 126 ms.
Limits of this comparison
Coval calls a Together-hosted deployment, preserving the difference between model behavior and infrastructure timing.
- Latency is not universal to Parakeet because self-hosted or differently optimized deployments can behave differently.
Official sources
- NVIDIA Parakeet TDT 0.6B v3 model card (model card)
Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.
Evaluate your own voice agent
Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.