NVIDIASPEECH-TO-TEXT145,951 SAMPLES / 30 DAYSLAST RUN AUG 28, 2026, 21:30 UTC

official resource

Parakeet TDT 0.6B v3 speech-to-text benchmarks

Parakeet TDT 0.6B v3 is an NVIDIA open-weight speech recognition model.

Overview

NVIDIA publishes the 0.6B transducer weights and model card; the tested deployment is Together shared inference.

Parakeet TDT 0.6B v3 is tested every day on fixed public audio — clean, accented, noisy, reverberant, far-field, clipped and phone-codec speech — for transcription accuracy and streaming latency.

Technical specifications

Made by
NVIDIA
Hosted by
Together AI
Source
Shared inference
Licensing
Open-weight
Deployment
Cloud
Region
US
Features
Multilingual

How Parakeet TDT 0.6B v3 ranks

Full STT dashboard
Time to Final Segment — every measured STT modelMilliseconds · lower is better · 30-day averageEvery STT model ranked on Time to Final Segment, with Parakeet TDT 0.6B v3 highlighted.
  1. #1STT RT v564 ms
  2. #3STT 183 ms
  3. #4Nova 399 ms
  4. #5Nova 2101 ms
  5. #6Ink 2108 ms
  6. #9Defaultvia Azure155 ms
  7. #12Grok STT199 ms
Show all 24 models
  1. #13Pulse205 ms
  2. #14Defaultvia Speechmatics223 ms
  3. #15Defaultvia Gradium249 ms
  4. #16resonant-1288 ms
  5. #17Enhanced341 ms
  6. #21Solaria 1680 ms
  7. #23Chirp 2811 ms
  8. #24Chirp 3813 ms
median of all models · 202 ms
STT models over the last 30 days, ranked on Time to Final Segment.
#ModelHostTTFSWERTTFTSamples
1STT RT v5Soniox64 ms1533 ms29,322
2Parakeet TDT 0.6B v3Together AI70 ms1210 ms29,161
3STT 1Inworld AI83 ms1468 ms29,280
4Nova 3Deepgram99 ms1434 ms29,290
5Nova 2Deepgram101 ms1436 ms29,145
6Ink 2Cartesia108 ms1812 ms29,288
7Scribe v2 RealtimeElevenLabs120 ms2157 ms29,313
8Universal 3.5 ProAssemblyAI146 ms1030 ms29,280
9DefaultAzure155 ms1792 ms6,682
10Whisper Large v3Together AI180 ms1241 ms29,171
11Velma 2 STT StreamingModulate191 ms1576 ms17,895
12Grok STTxAI199 ms29,322
13PulseSmallest205 ms2072 ms29,313
14DefaultSpeechmatics223 ms1473 ms29,323
15DefaultGradium249 ms1979 ms28,235
16resonant-1Reson8288 ms17,066
17EnhancedSpeechmatics341 ms1536 ms29,322
18Voxtral Mini Transcribe Realtime 2602Mistral356 ms1828 ms29,175
19GPT Realtime WhisperOpenAI559 ms1823 ms29,286
20GPT-4o mini TranscribeOpenAI623 ms29,318
21Solaria 1Gladia680 ms1703 ms26,356
22GPT-4o TranscribeOpenAI742 ms29,318
23Chirp 2Google811 ms6000 ms29,237
24Chirp 3Google813 ms5999 ms29,319
FluxDeepgram1089 ms29,354
Flux MultilingualDeepgram1175 ms29,344
Nemotron 3.5 ASR StreamingTogether AI1540 ms29,193
Universal StreamingAssemblyAI1510 ms29,297
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Latency vs accuracy

TTFS vs WEREach point is one measured model · Parakeet TDT 0.6B v3 highlighted · 30-day averagesTime to Final Segment against Word Error Rate for every measured STT model, with Parakeet TDT 0.6B v3 highlighted.

Where the errors come from

WER compositionParakeet TDT 0.6B v3's Word Error Rate split by error type · 30-day averageParakeet TDT 0.6B v3's WER split into substitutions, deletions and insertions.
  • Parakeet TDT 0.6B v311.0%
SubstitutionsDeletionsInsertions

Averages and tail latency

Averages hide slow outliers — these are the distributions behind each figure.

Parakeet TDT 0.6B v3 latency distributionMilliseconds · shared axis across metrics · last 30 daysParakeet TDT 0.6B v3's latency percentiles per metric: p25–p75 band, p50 tick, whisker to p99.
  • Time to Final Segmentp50 62 ms · p99 167 ms
  • Time to First Tokenp50 1337 ms · p99 3042 ms
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops
Average and percentile values per metric, with the number of samples behind each row.
MetricAveragep25p50p75p90p95p99Samples
Time to Final Segment70 ms42 ms62 ms113 ms123 ms129 ms167 ms29,161
Word Error Rate11.0%0.0%6.9%14.3%27.3%38.1%71.4%29,201
Time to First Token1210 ms841 ms1337 ms1422 ms1642 ms2028 ms3042 ms29,187

Last 30 days

Daily medians from the same measurement runs · gaps are days without qualifying runs.

Time to Final Segment — daily p50Line p50 · band p25–p75 · UTC daysParakeet TDT 0.6B v3's daily median Time to Final Segment over the last 30 days.
Parakeet TDT 0.6B v3 · Jul 30: 52 msParakeet TDT 0.6B v3 · Jul 31: 42 msParakeet TDT 0.6B v3 · Aug 1: 51 msParakeet TDT 0.6B v3 · Aug 2: 44 msParakeet TDT 0.6B v3 · Aug 3: 59 msParakeet TDT 0.6B v3 · Aug 4: 59 msParakeet TDT 0.6B v3 · Aug 5: 63 msParakeet TDT 0.6B v3 · Aug 6: 66 msParakeet TDT 0.6B v3 · Aug 7: 65 msParakeet TDT 0.6B v3 · Aug 8: 65 msParakeet TDT 0.6B v3 · Aug 9: 65 msParakeet TDT 0.6B v3 · Aug 10: 64 msParakeet TDT 0.6B v3 · Aug 11: 65 msParakeet TDT 0.6B v3 · Aug 12: 78 msParakeet TDT 0.6B v3 · Aug 13: 80 msParakeet TDT 0.6B v3 · Aug 14: 79 msParakeet TDT 0.6B v3 · Aug 15: 110 msParakeet TDT 0.6B v3 · Aug 16: 45 msParakeet TDT 0.6B v3 · Aug 17: 79 msParakeet TDT 0.6B v3 · Aug 18: 78 msParakeet TDT 0.6B v3 · Aug 19: 79 msParakeet TDT 0.6B v3 · Aug 20: 47 msParakeet TDT 0.6B v3 · Aug 21: 84 msParakeet TDT 0.6B v3 · Aug 22: 117 msParakeet TDT 0.6B v3 · Aug 23: 50 msParakeet TDT 0.6B v3 · Aug 24: 88 msParakeet TDT 0.6B v3 · Aug 25: 87 msParakeet TDT 0.6B v3 · Aug 26: 81 msParakeet TDT 0.6B v3 · Aug 27: 45 msParakeet TDT 0.6B v3 · Aug 28: 80 ms
Word Error Rate — daily averageDaily average · UTC daysParakeet TDT 0.6B v3's daily Word Error Rate over the last 30 days.
Parakeet TDT 0.6B v3 · Jul 30: 9.2%Parakeet TDT 0.6B v3 · Jul 31: 11.6%Parakeet TDT 0.6B v3 · Aug 1: 10.6%Parakeet TDT 0.6B v3 · Aug 2: 13.2%Parakeet TDT 0.6B v3 · Aug 3: 11.1%Parakeet TDT 0.6B v3 · Aug 4: 12.7%Parakeet TDT 0.6B v3 · Aug 5: 11.7%Parakeet TDT 0.6B v3 · Aug 6: 10.5%Parakeet TDT 0.6B v3 · Aug 7: 13.1%Parakeet TDT 0.6B v3 · Aug 8: 10.8%Parakeet TDT 0.6B v3 · Aug 9: 12.4%Parakeet TDT 0.6B v3 · Aug 10: 10.0%Parakeet TDT 0.6B v3 · Aug 11: 14.8%Parakeet TDT 0.6B v3 · Aug 12: 10.0%Parakeet TDT 0.6B v3 · Aug 13: 12.0%Parakeet TDT 0.6B v3 · Aug 14: 11.1%Parakeet TDT 0.6B v3 · Aug 15: 11.6%Parakeet TDT 0.6B v3 · Aug 16: 10.5%Parakeet TDT 0.6B v3 · Aug 17: 12.8%Parakeet TDT 0.6B v3 · Aug 18: 11.8%Parakeet TDT 0.6B v3 · Aug 19: 12.4%Parakeet TDT 0.6B v3 · Aug 20: 11.9%Parakeet TDT 0.6B v3 · Aug 21: 11.4%Parakeet TDT 0.6B v3 · Aug 22: 12.4%Parakeet TDT 0.6B v3 · Aug 23: 12.4%Parakeet TDT 0.6B v3 · Aug 24: 11.8%Parakeet TDT 0.6B v3 · Aug 25: 11.9%Parakeet TDT 0.6B v3 · Aug 26: 11.3%Parakeet TDT 0.6B v3 · Aug 27: 12.4%Parakeet TDT 0.6B v3 · Aug 28: 14.1%

Time to Final Segment by dataset

Parakeet TDT 0.6B v3 by test conditionMilliseconds · lower is better · best condition firstParakeet TDT 0.6B v3's Time to Final Segment on each benchmark dataset.
Time to Final Segment per dataset, with the number of samples behind each figure.
DatasetTTFSSamples
LibriSpeech126 ms1
ProductionPipeCat70 ms14,831
AccentsWildASR73 ms1,436
CleanWildASR66 ms5,756
ClippingWildASR71 ms1,440
Far-fieldWildASR70 ms1,439
Noise gapsWildASR67 ms1,436
Phone codecWildASR72 ms1,433
ReverbWildASR71 ms1,389

Strongest condition: WildASR clean at 66 ms · weakest: LibriSpeech at 126 ms.

Limits of this comparison

Coval calls a Together-hosted deployment, preserving the difference between model behavior and infrastructure timing.

  • Latency is not universal to Parakeet because self-hosted or differently optimized deployments can behave differently.

Official sources

Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo