MISTRALSPEECH-TO-TEXT145,999 SAMPLES / 30 DAYSLAST RUN AUG 28, 2026, 21:30 UTC

official resource

Voxtral Mini Transcribe Realtime 2602 speech-to-text benchmarks

Voxtral Mini Transcribe Realtime 2602 is Mistral AI's compact real-time transcription release identified by its February 2026 suffix.

Word Error Rate#17 / 28
6.2%
Time to First Token#19 / 24
1828ms

Overview

Voxtral Mini Transcribe belongs to Mistral's Voxtral audio family; the tested European endpoint is multilingual and open-weight.

Voxtral Mini Transcribe Realtime 2602 is tested every day on fixed public audio — clean, accented, noisy, reverberant, far-field, clipped and phone-codec speech — for transcription accuracy and streaming latency.

Technical specifications

Made by
Mistral
Hosted by
Mistral
Source
Official API
Licensing
Open-weight
Deployment
Cloud
Region
Europe
Features
Multilingual

How Voxtral Mini Transcribe Realtime 2602 ranks

Full STT dashboard
Time to Final Segment — every measured STT modelMilliseconds · lower is better · 30-day averageEvery STT model ranked on Time to Final Segment, with Voxtral Mini Transcribe Realtime 2602 highlighted.
  1. #1STT RT v564 ms
  2. #3STT 183 ms
  3. #4Nova 399 ms
  4. #5Nova 2101 ms
  5. #6Ink 2108 ms
  6. #9Defaultvia Azure155 ms
  7. #12Grok STT199 ms
  8. #13Pulse205 ms
  9. #14Defaultvia Speechmatics223 ms
  10. #15Defaultvia Gradium249 ms
  11. #16resonant-1288 ms
  12. #17Enhanced341 ms
Show all 24 models
  1. #21Solaria 1680 ms
  2. #23Chirp 2811 ms
  3. #24Chirp 3813 ms
median of all models · 202 ms
STT models over the last 30 days, ranked on Time to Final Segment.
#ModelHostTTFSWERTTFTSamples
1STT RT v5Soniox64 ms1533 ms29,322
2Parakeet TDT 0.6B v3Together AI70 ms1210 ms29,161
3STT 1Inworld AI83 ms1468 ms29,280
4Nova 3Deepgram99 ms1434 ms29,290
5Nova 2Deepgram101 ms1436 ms29,145
6Ink 2Cartesia108 ms1812 ms29,288
7Scribe v2 RealtimeElevenLabs120 ms2157 ms29,313
8Universal 3.5 ProAssemblyAI146 ms1030 ms29,280
9DefaultAzure155 ms1792 ms6,682
10Whisper Large v3Together AI180 ms1241 ms29,171
11Velma 2 STT StreamingModulate191 ms1576 ms17,895
12Grok STTxAI199 ms29,322
13PulseSmallest205 ms2072 ms29,313
14DefaultSpeechmatics223 ms1473 ms29,323
15DefaultGradium249 ms1979 ms28,235
16resonant-1Reson8288 ms17,066
17EnhancedSpeechmatics341 ms1536 ms29,322
18Voxtral Mini Transcribe Realtime 2602Mistral356 ms1828 ms29,175
19GPT Realtime WhisperOpenAI559 ms1823 ms29,286
20GPT-4o mini TranscribeOpenAI623 ms29,318
21Solaria 1Gladia680 ms1703 ms26,356
22GPT-4o TranscribeOpenAI742 ms29,318
23Chirp 2Google811 ms6000 ms29,237
24Chirp 3Google813 ms5999 ms29,319
FluxDeepgram1089 ms29,354
Flux MultilingualDeepgram1175 ms29,344
Nemotron 3.5 ASR StreamingTogether AI1540 ms29,193
Universal StreamingAssemblyAI1510 ms29,297
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Highest relative placement: 17th of 28 on Word Error Rate.

Latency vs accuracy

TTFS vs WEREach point is one measured model · Voxtral Mini Transcribe Realtime 2602 highlighted · 30-day averagesTime to Final Segment against Word Error Rate for every measured STT model, with Voxtral Mini Transcribe Realtime 2602 highlighted.

Where the errors come from

WER compositionVoxtral Mini Transcribe Realtime 2602's Word Error Rate split by error type · 30-day averageVoxtral Mini Transcribe Realtime 2602's WER split into substitutions, deletions and insertions.
  • Voxtral Mini Transcribe Realtime 26026.2%
SubstitutionsDeletionsInsertions

Averages and tail latency

Averages hide slow outliers — these are the distributions behind each figure.

Voxtral Mini Transcribe Realtime 2602 latency distributionMilliseconds · shared axis across metrics · last 30 daysVoxtral Mini Transcribe Realtime 2602's latency percentiles per metric: p25–p75 band, p50 tick, whisker to p99.
  • Time to Final Segmentp50 310 ms · p99 1025 ms
  • Time to First Tokenp50 1835 ms · p99 3734 ms
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops
Average and percentile values per metric, with the number of samples behind each row.
MetricAveragep25p50p75p90p95p99Samples
Time to Final Segment356 ms290 ms310 ms351 ms429 ms514 ms1025 ms29,175
Word Error Rate6.2%0.0%2.5%8.3%16.7%22.7%53.3%29,206
Time to First Token1828 ms1537 ms1835 ms2042 ms2340 ms2717 ms3734 ms29,206

Last 30 days

Daily medians from the same measurement runs · gaps are days without qualifying runs.

Time to Final Segment — daily p50Line p50 · band p25–p75 · UTC daysVoxtral Mini Transcribe Realtime 2602's daily median Time to Final Segment over the last 30 days.
Voxtral Mini Transcribe Realtime 2602 · Jul 30: 303 msVoxtral Mini Transcribe Realtime 2602 · Jul 31: 302 msVoxtral Mini Transcribe Realtime 2602 · Aug 1: 294 msVoxtral Mini Transcribe Realtime 2602 · Aug 2: 287 msVoxtral Mini Transcribe Realtime 2602 · Aug 3: 299 msVoxtral Mini Transcribe Realtime 2602 · Aug 4: 305 msVoxtral Mini Transcribe Realtime 2602 · Aug 5: 309 msVoxtral Mini Transcribe Realtime 2602 · Aug 6: 314 msVoxtral Mini Transcribe Realtime 2602 · Aug 7: 301 msVoxtral Mini Transcribe Realtime 2602 · Aug 8: 287 msVoxtral Mini Transcribe Realtime 2602 · Aug 9: 286 msVoxtral Mini Transcribe Realtime 2602 · Aug 10: 304 msVoxtral Mini Transcribe Realtime 2602 · Aug 11: 303 msVoxtral Mini Transcribe Realtime 2602 · Aug 12: 302 msVoxtral Mini Transcribe Realtime 2602 · Aug 13: 317 msVoxtral Mini Transcribe Realtime 2602 · Aug 14: 313 msVoxtral Mini Transcribe Realtime 2602 · Aug 15: 304 msVoxtral Mini Transcribe Realtime 2602 · Aug 16: 293 msVoxtral Mini Transcribe Realtime 2602 · Aug 17: 310 msVoxtral Mini Transcribe Realtime 2602 · Aug 18: 304 msVoxtral Mini Transcribe Realtime 2602 · Aug 19: 376 msVoxtral Mini Transcribe Realtime 2602 · Aug 20: 358 msVoxtral Mini Transcribe Realtime 2602 · Aug 21: 351 msVoxtral Mini Transcribe Realtime 2602 · Aug 22: 294 msVoxtral Mini Transcribe Realtime 2602 · Aug 23: 301 msVoxtral Mini Transcribe Realtime 2602 · Aug 24: 323 msVoxtral Mini Transcribe Realtime 2602 · Aug 25: 338 msVoxtral Mini Transcribe Realtime 2602 · Aug 26: 330 msVoxtral Mini Transcribe Realtime 2602 · Aug 27: 335 msVoxtral Mini Transcribe Realtime 2602 · Aug 28: 420 ms
Word Error Rate — daily averageDaily average · UTC daysVoxtral Mini Transcribe Realtime 2602's daily Word Error Rate over the last 30 days.
Voxtral Mini Transcribe Realtime 2602 · Jul 30: 4.3%Voxtral Mini Transcribe Realtime 2602 · Jul 31: 8.2%Voxtral Mini Transcribe Realtime 2602 · Aug 1: 7.0%Voxtral Mini Transcribe Realtime 2602 · Aug 2: 7.6%Voxtral Mini Transcribe Realtime 2602 · Aug 3: 5.7%Voxtral Mini Transcribe Realtime 2602 · Aug 4: 9.0%Voxtral Mini Transcribe Realtime 2602 · Aug 5: 8.4%Voxtral Mini Transcribe Realtime 2602 · Aug 6: 6.4%Voxtral Mini Transcribe Realtime 2602 · Aug 7: 8.2%Voxtral Mini Transcribe Realtime 2602 · Aug 8: 6.8%Voxtral Mini Transcribe Realtime 2602 · Aug 9: 7.9%Voxtral Mini Transcribe Realtime 2602 · Aug 10: 7.9%Voxtral Mini Transcribe Realtime 2602 · Aug 11: 8.2%Voxtral Mini Transcribe Realtime 2602 · Aug 12: 6.6%Voxtral Mini Transcribe Realtime 2602 · Aug 13: 7.7%Voxtral Mini Transcribe Realtime 2602 · Aug 14: 7.5%Voxtral Mini Transcribe Realtime 2602 · Aug 15: 6.0%Voxtral Mini Transcribe Realtime 2602 · Aug 16: 8.9%Voxtral Mini Transcribe Realtime 2602 · Aug 17: 6.6%Voxtral Mini Transcribe Realtime 2602 · Aug 18: 7.6%Voxtral Mini Transcribe Realtime 2602 · Aug 19: 7.7%Voxtral Mini Transcribe Realtime 2602 · Aug 20: 6.4%Voxtral Mini Transcribe Realtime 2602 · Aug 21: 6.3%Voxtral Mini Transcribe Realtime 2602 · Aug 22: 9.3%Voxtral Mini Transcribe Realtime 2602 · Aug 23: 6.5%Voxtral Mini Transcribe Realtime 2602 · Aug 24: 6.8%Voxtral Mini Transcribe Realtime 2602 · Aug 25: 6.6%Voxtral Mini Transcribe Realtime 2602 · Aug 26: 7.5%Voxtral Mini Transcribe Realtime 2602 · Aug 27: 7.7%Voxtral Mini Transcribe Realtime 2602 · Aug 28: 6.7%

Time to Final Segment by dataset

Voxtral Mini Transcribe Realtime 2602 by test conditionMilliseconds · lower is better · best condition firstVoxtral Mini Transcribe Realtime 2602's Time to Final Segment on each benchmark dataset.
Time to Final Segment per dataset, with the number of samples behind each figure.
DatasetTTFSSamples
LibriSpeech288 ms1
ProductionPipeCat353 ms14,907
AccentsWildASR346 ms1,434
CleanWildASR353 ms5,769
ClippingWildASR362 ms1,408
Far-fieldWildASR359 ms1,435
Noise gapsWildASR354 ms1,439
Phone codecWildASR382 ms1,438
ReverbWildASR369 ms1,344

Strongest condition: LibriSpeech at 288 ms · weakest: WildASR phone codec at 382 ms.

Limits of this comparison

Results remain attached to this version if a later release becomes available.

  • A dated identifier can be superseded, so results remain attached to 2602 rather than silently following a newer alias.

Official sources

Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo