MISTRAL AISPEECH-TO-TEXT113,027 SAMPLES / 30 DAYSLAST RUN SEP 15, 2026, 08:30 UTC

official resource

Voxtral Mini Transcribe Realtime 2602 speech-to-text benchmarks

Voxtral Mini Transcribe Realtime 2602, hosted by Mistral AI, measures mean 401 ms time to final segment (22nd of 28) and 6.2% word error rate (21st of 30) among STT systems. Results cover the last 30 days. Last measured .

Voxtral Mini Transcribe Realtime 2602 is Mistral AI's compact real-time transcription release identified by its February 2026 suffix.

Word Error Rate#21 / 30
6.2%
Time to First Token#21 / 26
1851ms

Overview

Voxtral Mini Transcribe belongs to Mistral's Voxtral audio family; the tested European endpoint is multilingual and open-weight.

Voxtral Mini Transcribe Realtime 2602 is tested every day on fixed public audio — clean, accented, noisy, reverberant, far-field, clipped and phone-codec speech — for transcription accuracy and streaming latency.

Technical specifications

Made by
Mistral AI
Hosted by
Mistral AI
Source
Official API
Licensing
Open-weight
Deployment
Cloud
Region
Europe
Features
Multilingual

How Voxtral Mini Transcribe Realtime 2602 ranks

Full STT dashboard
Time to Final Segment — every measured STT modelMilliseconds · lower is better · 30-day averageEvery STT model ranked on Time to Final Segment, with Voxtral Mini Transcribe Realtime 2602 highlighted.
  1. #1Qwen3 ASR 1.7b39 ms
  2. #3STT RT v557 ms
  3. #4STT 165 ms
  4. #6Nova 389 ms
  5. #7Nova 292 ms
  6. #9Flux99 ms
  7. #10Ink 2122 ms
  8. #11Whisper Large v3via Baseten125 ms
  9. #14Grok STT207 ms
  10. #15Defaultvia Speechmatics209 ms
  11. #16Pulse212 ms
  12. #17Defaultvia Gradium246 ms
  13. #18resonant-1264 ms
  14. #19Whisper Large v3via Together AI295 ms
  15. #20Enhanced299 ms
Show all 28 models
  1. #26Chirp 3776 ms
  2. #27Solaria 1805 ms
  3. #28Chirp 2873 ms
median of all models · 208 ms
STT models over the last 30 days, ranked on Time to Final Segment.
#ModelHostTTFSWERTTFTSamples
1Qwen3 ASR 1.7bBaseten39 ms931 ms1,256
2Qwen3 ASR FastNari46 ms1748 ms4,451
3STT RT v5Soniox57 ms1529 ms22,468
4STT 1Inworld AI65 ms1400 ms22,836
5Parakeet TDT 0.6B v3Together AI81 ms1215 ms22,488
6Nova 3Deepgram89 ms1419 ms22,855
7Nova 2Deepgram92 ms1420 ms22,733
8Flux MultilingualDeepgram98 ms1164 ms12,251
9FluxDeepgram99 ms1076 ms12,243
10Ink 2Cartesia122 ms1827 ms22,862
11Whisper Large v3Baseten125 ms912 ms1,252
12Scribe v2 RealtimeElevenLabs133 ms2175 ms22,866
13Universal 3.5 ProAssemblyAI173 ms1041 ms20,253
14Grok STTxAI207 ms22,853
15DefaultSpeechmatics209 ms1428 ms22,876
16PulseSmallest212 ms2011 ms22,856
17DefaultGradium246 ms1980 ms22,839
18resonant-1Reson8264 ms22,860
19Whisper Large v3Together AI295 ms1338 ms22,744
20EnhancedSpeechmatics299 ms1492 ms22,876
21Gemini 3.5 Transcribe LiveGemini305 ms1679 ms16,403
22Voxtral Mini Transcribe Realtime 2602Mistral401 ms1851 ms22,583
23GPT Realtime WhisperOpenAI551 ms1814 ms22,812
24GPT-4o mini TranscribeOpenAI690 ms22,830
25GPT-4o TranscribeOpenAI754 ms22,831
26Chirp 3Google776 ms5974 ms22,875
27Solaria 1Gladia805 ms1804 ms22,439
28Chirp 2Google873 ms6071 ms22,789
Nemotron 3.5 ASR StreamingTogether AI1548 ms22,747
Universal StreamingAssemblyAI1514 ms20,235
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Highest relative placement: 21st of 30 on Word Error Rate.

Latency vs accuracy

Where the errors come from

WER compositionVoxtral Mini Transcribe Realtime 2602's Word Error Rate split by error type · 30-day averageVoxtral Mini Transcribe Realtime 2602's WER split into substitutions, deletions and insertions.
  • Voxtral Mini Transcribe Realtime 26026.2%
SubstitutionsDeletionsInsertions

Averages and tail latency

Averages hide slow outliers — these are the distributions behind each figure.

Voxtral Mini Transcribe Realtime 2602 latency distributionMilliseconds · shared axis across metrics · last 30 daysVoxtral Mini Transcribe Realtime 2602's latency percentiles per metric: p25–p75 band, p50 tick, whisker to p99.
  • Time to Final Segmentp50 329 ms · p99 1598 ms
  • Time to First Tokenp50 1839 ms · p99 3749 ms
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops
Average and percentile values per metric, with the number of samples behind each row.
MetricAveragep25p50p75p90p95p99Samples
Time to Final Segment401 ms300 ms329 ms391 ms493 ms589 ms1598 ms22,583
Word Error Rate6.2%0.0%2.5%8.3%16.7%22.7%62.5%22,611
Time to First Token1851 ms1540 ms1839 ms2046 ms2352 ms2737 ms3749 ms22,611

Last 30 days

Daily medians from the same measurement runs · gaps are days without qualifying runs.

Time to Final Segment — daily p50Line p50 · band p25–p75 · UTC daysVoxtral Mini Transcribe Realtime 2602's daily median Time to Final Segment over the last 30 days.
Voxtral Mini Transcribe Realtime 2602 · Sep 1: 330 msVoxtral Mini Transcribe Realtime 2602 · Sep 2: 379 msVoxtral Mini Transcribe Realtime 2602 · Sep 3: 332 msVoxtral Mini Transcribe Realtime 2602 · Sep 4: 340 msVoxtral Mini Transcribe Realtime 2602 · Sep 5: 323 msVoxtral Mini Transcribe Realtime 2602 · Sep 6: 308 msVoxtral Mini Transcribe Realtime 2602 · Sep 7: 328 msVoxtral Mini Transcribe Realtime 2602 · Sep 8: 342 msVoxtral Mini Transcribe Realtime 2602 · Sep 9: 338 msVoxtral Mini Transcribe Realtime 2602 · Sep 10: 335 msVoxtral Mini Transcribe Realtime 2602 · Sep 11: 338 msVoxtral Mini Transcribe Realtime 2602 · Sep 12: 300 msVoxtral Mini Transcribe Realtime 2602 · Sep 13: 299 msVoxtral Mini Transcribe Realtime 2602 · Sep 14: 345 msVoxtral Mini Transcribe Realtime 2602 · Sep 15: 327 ms
Word Error Rate — daily averageDaily average · UTC daysVoxtral Mini Transcribe Realtime 2602's daily Word Error Rate over the last 30 days.
Voxtral Mini Transcribe Realtime 2602 · Sep 1: 5.7%Voxtral Mini Transcribe Realtime 2602 · Sep 2: 7.5%Voxtral Mini Transcribe Realtime 2602 · Sep 3: 6.9%Voxtral Mini Transcribe Realtime 2602 · Sep 4: 6.8%Voxtral Mini Transcribe Realtime 2602 · Sep 5: 7.2%Voxtral Mini Transcribe Realtime 2602 · Sep 6: 6.4%Voxtral Mini Transcribe Realtime 2602 · Sep 7: 7.9%Voxtral Mini Transcribe Realtime 2602 · Sep 8: 7.0%Voxtral Mini Transcribe Realtime 2602 · Sep 9: 7.6%Voxtral Mini Transcribe Realtime 2602 · Sep 10: 6.0%Voxtral Mini Transcribe Realtime 2602 · Sep 11: 7.6%Voxtral Mini Transcribe Realtime 2602 · Sep 12: 7.8%Voxtral Mini Transcribe Realtime 2602 · Sep 13: 6.9%Voxtral Mini Transcribe Realtime 2602 · Sep 14: 6.9%Voxtral Mini Transcribe Realtime 2602 · Sep 15: 6.5%

Time to Final Segment by dataset

Voxtral Mini Transcribe Realtime 2602 by test conditionMilliseconds · lower is better · best condition firstVoxtral Mini Transcribe Realtime 2602's Time to Final Segment on each benchmark dataset.
Time to Final Segment per dataset, with the number of samples behind each figure.
DatasetTTFSSamples
LibriSpeech288 ms1
ProductionPipeCat398 ms11,424
AccentsWildASR369 ms1,105
CleanWildASR393 ms4,531
ClippingWildASR394 ms1,102
Far-fieldWildASR400 ms1,131
Noise gapsWildASR413 ms1,127
Phone codecWildASR455 ms1,122
ReverbWildASR426 ms1,040

Strongest condition: LibriSpeech at 288 ms · weakest: WildASR phone codec at 455 ms.

How fast is Voxtral Mini Transcribe Realtime 2602?

On Mistral AI, Voxtral Mini Transcribe Realtime 2602 measures mean 401 ms time to final segment (22nd of 28) and mean 1851 ms time to first token (21st of 26). Last measured 2026-09-15.

How accurate is Voxtral Mini Transcribe Realtime 2602?

On Mistral AI, Voxtral Mini Transcribe Realtime 2602 measures 6.2% word error rate (21st of 30). Last measured 2026-09-15.

Who hosts Voxtral Mini Transcribe Realtime 2602?

Voxtral Mini Transcribe Realtime 2602 is created by Mistral AI and served by Mistral AI. Coval measures each hosted endpoint separately.

Limits of this comparison

Results remain attached to this version if a later release becomes available.

  • A dated identifier can be superseded, so results remain attached to 2602 rather than silently following a newer alias.

Official sources

Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo