BENCHMARKSTTTTS58 MODELS RANKEDLAST 30 DAYS

Word Error Rate (WER)

Word Error Rate (WER) is the share of words a transcript gets wrong: substitutions, insertions and deletions, measured against a reference.

Current STT leader#1 / 28
3.2%
Universal 3.5 Provia AssemblyAI
Current TTS leader#1 / 30
3.7%
TTS RT v1via Soniox

How it is calculated

WER = (substitutions + deletions + insertions) ÷ reference-word count × 100.

How to read it

Unit
%
Better
Lower
Period
Rolling 30 days
Cadence
Re-measured daily

Speech-to-Text models on Word Error Rate

Full STT dashboard
Word Error Rate — every measured STT modelPercent · lower is better · 30-day averageEvery STT model ranked on Word Error Rate.
  1. #2resonant-13.4%
  2. #3Chirp 34.1%
  3. #4Enhanced4.3%
  4. #6Grok STT4.8%
  5. #7STT 14.8%
  6. #8Ink 24.9%
  7. #9Chirp 25.0%
  8. #12Pulse5.3%
Show all 28 models
  1. #13Defaultvia Azure5.3%
  2. #14Defaultvia Speechmatics5.5%
  3. #16STT RT v55.8%
  4. #18Nova 36.3%
  5. #20Flux6.6%
  6. #22Solaria 17.1%
  7. #23Nova 27.9%
  8. #26Defaultvia Gradium10.0%
median of all models · 5.5%
STT models over the last 30 days, ranked on Word Error Rate.
#ModelHostTTFSWERTTFTSamples
1Universal 3.5 ProAssemblyAI146 ms1030 ms29,315
2resonant-1Reson8288 ms17,091
3Chirp 3Google813 ms5999 ms29,360
4EnhancedSpeechmatics341 ms1536 ms29,356
5GPT-4o TranscribeOpenAI742 ms29,359
6Grok STTxAI199 ms29,363
7STT 1Inworld AI83 ms1468 ms29,321
8Ink 2Cartesia108 ms1812 ms29,329
9Chirp 2Google811 ms6000 ms29,278
10GPT-4o mini TranscribeOpenAI623 ms29,359
11GPT Realtime WhisperOpenAI559 ms1823 ms29,327
12PulseSmallest205 ms2072 ms29,354
13DefaultAzure155 ms1792 ms6,689
14DefaultSpeechmatics223 ms1473 ms29,353
15Scribe v2 RealtimeElevenLabs120 ms2157 ms29,354
16STT RT v5Soniox64 ms1533 ms29,363
17Voxtral Mini Transcribe Realtime 2602Mistral356 ms1828 ms29,206
18Nova 3Deepgram99 ms1434 ms29,335
19Velma 2 STT StreamingModulate191 ms1576 ms17,919
20FluxDeepgram1089 ms29,354
21Universal StreamingAssemblyAI1510 ms29,297
22Solaria 1Gladia680 ms1703 ms26,391
23Nova 2Deepgram101 ms1436 ms29,310
24Whisper Large v3Together AI180 ms1241 ms29,232
25Flux MultilingualDeepgram1175 ms29,344
26DefaultGradium249 ms1979 ms28,273
27Parakeet TDT 0.6B v3Together AI70 ms1210 ms29,201
28Nemotron 3.5 ASR StreamingTogether AI1540 ms29,193
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Speech-to-Text: where the errors come from

WER composition — STTPercentage points of average WER · lower is betterEach STT model's WER split into substitutions, deletions and insertions.
SubstitutionsDeletionsInsertions

Models without a published error split are not shown here.

Speech-to-Text: last 30 days

Daily average for the current top 5 · gaps are days without qualifying runs.

Word Error Rate — current leadersDaily average per model · UTC daysDaily Word Error Rate for the current top STT models over the last 30 days.
Chirp 3 · Jul 31: 4.9%Chirp 3 · Aug 1: 4.3%Chirp 3 · Aug 2: 6.0%Chirp 3 · Aug 3: 4.2%Chirp 3 · Aug 4: 5.7%Chirp 3 · Aug 5: 6.6%Chirp 3 · Aug 6: 3.8%Chirp 3 · Aug 7: 6.6%Chirp 3 · Aug 8: 5.4%Chirp 3 · Aug 9: 5.9%Chirp 3 · Aug 10: 5.8%Chirp 3 · Aug 11: 5.7%Chirp 3 · Aug 12: 3.3%Chirp 3 · Aug 13: 5.7%Chirp 3 · Aug 14: 5.6%Chirp 3 · Aug 15: 5.1%Chirp 3 · Aug 16: 6.0%Chirp 3 · Aug 17: 4.3%Chirp 3 · Aug 18: 6.0%Chirp 3 · Aug 19: 5.3%Chirp 3 · Aug 20: 4.9%Chirp 3 · Aug 21: 4.2%Chirp 3 · Aug 22: 6.6%Chirp 3 · Aug 23: 5.1%Chirp 3 · Aug 24: 5.1%Chirp 3 · Aug 25: 4.4%Chirp 3 · Aug 26: 3.8%Chirp 3 · Aug 27: 6.0%Chirp 3 · Aug 28: 6.1%Enhanced · Jul 31: 5.8%Enhanced · Aug 1: 4.3%Enhanced · Aug 2: 5.0%Enhanced · Aug 3: 4.2%Enhanced · Aug 4: 5.4%Enhanced · Aug 5: 6.0%Enhanced · Aug 6: 5.5%Enhanced · Aug 7: 6.0%Enhanced · Aug 8: 4.7%Enhanced · Aug 9: 5.5%Enhanced · Aug 10: 5.2%Enhanced · Aug 11: 4.6%Enhanced · Aug 12: 4.9%Enhanced · Aug 13: 4.2%Enhanced · Aug 14: 6.0%Enhanced · Aug 15: 4.5%Enhanced · Aug 16: 5.7%Enhanced · Aug 17: 5.0%Enhanced · Aug 18: 6.6%Enhanced · Aug 19: 5.2%Enhanced · Aug 20: 4.7%Enhanced · Aug 21: 6.4%Enhanced · Aug 22: 6.6%Enhanced · Aug 23: 4.1%Enhanced · Aug 24: 4.8%Enhanced · Aug 25: 5.1%Enhanced · Aug 26: 4.4%Enhanced · Aug 27: 5.8%Enhanced · Aug 28: 5.8%GPT-4o Transcribe · Jul 31: 6.2%GPT-4o Transcribe · Aug 1: 4.5%GPT-4o Transcribe · Aug 2: 6.5%GPT-4o Transcribe · Aug 3: 4.5%GPT-4o Transcribe · Aug 4: 6.2%GPT-4o Transcribe · Aug 5: 6.9%GPT-4o Transcribe · Aug 6: 4.8%GPT-4o Transcribe · Aug 7: 7.1%GPT-4o Transcribe · Aug 8: 5.6%GPT-4o Transcribe · Aug 9: 5.9%GPT-4o Transcribe · Aug 10: 7.1%GPT-4o Transcribe · Aug 11: 6.7%GPT-4o Transcribe · Aug 12: 5.5%GPT-4o Transcribe · Aug 13: 6.2%GPT-4o Transcribe · Aug 14: 7.0%GPT-4o Transcribe · Aug 15: 5.4%GPT-4o Transcribe · Aug 16: 6.2%GPT-4o Transcribe · Aug 17: 5.0%GPT-4o Transcribe · Aug 18: 6.9%GPT-4o Transcribe · Aug 19: 5.8%GPT-4o Transcribe · Aug 20: 6.0%GPT-4o Transcribe · Aug 21: 4.7%GPT-4o Transcribe · Aug 22: 6.4%GPT-4o Transcribe · Aug 23: 4.8%GPT-4o Transcribe · Aug 24: 5.1%GPT-4o Transcribe · Aug 25: 5.5%GPT-4o Transcribe · Aug 26: 5.5%GPT-4o Transcribe · Aug 27: 5.1%GPT-4o Transcribe · Aug 28: 6.6%resonant-1 · Aug 11: 4.1%resonant-1 · Aug 12: 4.0%resonant-1 · Aug 13: 3.6%resonant-1 · Aug 14: 4.6%resonant-1 · Aug 15: 3.3%resonant-1 · Aug 16: 4.5%resonant-1 · Aug 17: 4.3%resonant-1 · Aug 18: 4.3%resonant-1 · Aug 19: 4.5%resonant-1 · Aug 20: 4.6%resonant-1 · Aug 21: 3.4%resonant-1 · Aug 22: 4.7%resonant-1 · Aug 23: 4.1%resonant-1 · Aug 24: 3.7%resonant-1 · Aug 25: 3.8%resonant-1 · Aug 26: 3.6%resonant-1 · Aug 27: 4.2%resonant-1 · Aug 28: 4.1%Universal 3.5 Pro · Jul 31: 4.0%Universal 3.5 Pro · Aug 1: 3.2%Universal 3.5 Pro · Aug 2: 4.9%Universal 3.5 Pro · Aug 3: 2.7%Universal 3.5 Pro · Aug 4: 4.4%Universal 3.5 Pro · Aug 5: 4.7%Universal 3.5 Pro · Aug 6: 2.3%Universal 3.5 Pro · Aug 7: 5.5%Universal 3.5 Pro · Aug 8: 4.6%Universal 3.5 Pro · Aug 9: 5.2%Universal 3.5 Pro · Aug 10: 4.3%Universal 3.5 Pro · Aug 11: 5.4%Universal 3.5 Pro · Aug 12: 3.6%Universal 3.5 Pro · Aug 13: 4.0%Universal 3.5 Pro · Aug 14: 4.0%Universal 3.5 Pro · Aug 15: 3.3%Universal 3.5 Pro · Aug 16: 4.1%Universal 3.5 Pro · Aug 17: 4.0%Universal 3.5 Pro · Aug 18: 4.1%Universal 3.5 Pro · Aug 19: 4.5%Universal 3.5 Pro · Aug 20: 4.0%Universal 3.5 Pro · Aug 21: 4.0%Universal 3.5 Pro · Aug 22: 5.2%Universal 3.5 Pro · Aug 23: 4.8%Universal 3.5 Pro · Aug 24: 3.4%Universal 3.5 Pro · Aug 25: 4.3%Universal 3.5 Pro · Aug 26: 3.4%Universal 3.5 Pro · Aug 27: 4.3%Universal 3.5 Pro · Aug 28: 4.7%
Chirp 3EnhancedGPT-4o Transcriberesonant-1Universal 3.5 Pro

Speech-to-Text: Word Error Rate by dataset

The overall average split by test condition — where each model holds up and where it degrades.

Word Error Rate for every STT model, per dataset, over the last 30 days.
#ModelHostAll datasetsWildASR cleanPipeCat (production)WildASR accentsWildASR clippingWildASR far-fieldWildASR noise gapsWildASR phone codecWildASR reverb
1Universal 3.5 ProAssemblyAI
2resonant-1Reson8
3Chirp 3Google
4EnhancedSpeechmatics
5GPT-4o TranscribeOpenAI
6Grok STTxAI
7STT 1Inworld AI
8Ink 2Cartesia
9Chirp 2Google
10GPT-4o mini TranscribeOpenAI
11GPT Realtime WhisperOpenAI
12PulseSmallest
13DefaultAzure
14DefaultSpeechmatics
15Scribe v2 RealtimeElevenLabs
16STT RT v5Soniox
17Voxtral Mini Transcribe Realtime 2602Mistral
18Nova 3Deepgram
19Velma 2 STT StreamingModulate
20FluxDeepgram
21Universal StreamingAssemblyAI
22Solaria 1Gladia
23Nova 2Deepgram
24Whisper Large v3Together AI
25Flux MultilingualDeepgram
26DefaultGradium
27Parakeet TDT 0.6B v3Together AI
28Nemotron 3.5 ASR StreamingTogether AI
Ranked on the all-datasets average; a dash means the model was not measured on that dataset in the last 30 days. Cell shading deepens toward each column’s highest value. Dotted values split into substitutions, deletions and insertions on hover or tap.

Text-to-Speech models on Word Error Rate

Full TTS dashboard
Word Error Rate — every measured TTS modelPercent · lower is better · 30-day averageEvery TTS model ranked on Word Error Rate.
  1. #1TTS RT v13.7%
  2. #2TTS Rt v23.9%
  3. #3Neural4.3%
  4. #6Default4.6%
  5. #7S2.1 Pro4.6%
  6. #9Simba 3.24.7%
  7. #11Grok TTS4.7%
Show all 30 models
  1. #13TTS 24.8%
  2. #15TTS Flash 24.9%
  3. #16S14.9%
  4. #18Chirp 3 HD5.2%
  5. #19Coda5.2%
  6. #20Falcon 25.2%
  7. #21Simba 3.05.3%
  8. #22Aura 25.3%
  9. #23Sonic 3.65.5%
  10. #25Sonic 3.56.1%
  11. #26Mist v36.3%
  12. #27Flash v2.56.7%
  13. #28Blizzard7.4%
  14. #29vui7.9%
median of all models · 4.9%
TTS models over the last 30 days, ranked on Word Error Rate.
#ModelHostTTFAWERSamples
1TTS RT v1Soniox275 ms3.7%14,528
2TTS Rt v2Soniox262 ms8,849
3NeuralAzure236 ms4.3%3,350
4Eleven v3 ConversationalElevenLabs412 ms6,750
5Lightning v3.1 ProSmallest586 ms4.4%14,515
6DefaultGradium384 ms4.6%14,002
7S2.1 ProFish Audio374 ms10,222
8S2.1 Pro FreeFish Audio806 ms4.7%14,464
9Simba 3.2Speechify484 ms4.7%14,525
10Speech 2.8 HDMiniMax460 ms1,995
11Grok TTSxAI420 ms4.7%14,524
12GPT-4o mini TTSOpenAI1075 ms4.8%14,527
13TTS 2Inworld AI176 ms4.8%14,529
14Speech 2.8 TurboMiniMax411 ms4.8%1,997
15TTS Flash 2Inworld AI128 ms8,719
16S1Fish Audio434 ms4.9%10,236
17Dragon HD LatestAzure310 ms5.1%3,350
18Chirp 3 HDGoogle512 ms5.2%14,530
19CodaRime313 ms5.2%14,523
20Falcon 2Murf549 ms10,229
21Simba 3.0Speechify526 ms5.3%14,529
22Aura 2Deepgram328 ms5.3%14,501
23Sonic 3.6Cartesia466 ms560
24Palabra TTS v1Palabra116 ms5.9%14,396
25Sonic 3.5Cartesia274 ms6.1%14,513
26Mist v3Rime256 ms6.3%14,524
27Flash v2.5ElevenLabs455 ms6.7%9,259
28BlizzardLmnt235 ms7.4%14,117
29vuiFluxions124 ms8,624
30Qwen3 TTS Flash RealtimeAlibaba645 ms8.8%14,530
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Text-to-Speech: where the errors come from

WER composition — TTSPercentage points of average WER · lower is betterEach TTS model's WER split into substitutions, deletions and insertions.
SubstitutionsDeletionsInsertions

Models without a published error split are not shown here.

Text-to-Speech: last 30 days

Daily average for the current top 5 · gaps are days without qualifying runs.

Word Error Rate — current leadersDaily average per model · UTC daysDaily Word Error Rate for the current top TTS models over the last 30 days.
Eleven v3 Conversational · Aug 14: 1.4%Eleven v3 Conversational · Aug 15: 4.0%Eleven v3 Conversational · Aug 16: 4.7%Eleven v3 Conversational · Aug 17: 4.5%Eleven v3 Conversational · Aug 18: 4.3%Eleven v3 Conversational · Aug 19: 4.5%Eleven v3 Conversational · Aug 20: 4.9%Eleven v3 Conversational · Aug 21: 4.1%Eleven v3 Conversational · Aug 22: 4.4%Eleven v3 Conversational · Aug 23: 4.4%Eleven v3 Conversational · Aug 24: 4.3%Eleven v3 Conversational · Aug 25: 4.2%Eleven v3 Conversational · Aug 26: 4.8%Eleven v3 Conversational · Aug 27: 4.0%Eleven v3 Conversational · Aug 28: 4.7%Lightning v3.1 Pro · Jul 31: 3.8%Lightning v3.1 Pro · Aug 1: 5.8%Lightning v3.1 Pro · Aug 2: 4.5%Lightning v3.1 Pro · Aug 3: 4.7%Lightning v3.1 Pro · Aug 4: 4.6%Lightning v3.1 Pro · Aug 5: 4.5%Lightning v3.1 Pro · Aug 6: 4.4%Lightning v3.1 Pro · Aug 7: 4.9%Lightning v3.1 Pro · Aug 8: 5.7%Lightning v3.1 Pro · Aug 9: 5.0%Lightning v3.1 Pro · Aug 10: 4.4%Lightning v3.1 Pro · Aug 11: 5.3%Lightning v3.1 Pro · Aug 12: 4.8%Lightning v3.1 Pro · Aug 13: 3.6%Lightning v3.1 Pro · Aug 14: 4.6%Lightning v3.1 Pro · Aug 15: 3.7%Lightning v3.1 Pro · Aug 16: 5.2%Lightning v3.1 Pro · Aug 17: 5.0%Lightning v3.1 Pro · Aug 18: 4.1%Lightning v3.1 Pro · Aug 19: 4.5%Lightning v3.1 Pro · Aug 20: 4.8%Lightning v3.1 Pro · Aug 21: 4.9%Lightning v3.1 Pro · Aug 22: 4.6%Lightning v3.1 Pro · Aug 23: 4.0%Lightning v3.1 Pro · Aug 24: 4.5%Lightning v3.1 Pro · Aug 25: 4.4%Lightning v3.1 Pro · Aug 26: 4.8%Lightning v3.1 Pro · Aug 27: 4.1%Lightning v3.1 Pro · Aug 28: 4.2%Neural · Jul 31: 3.7%Neural · Aug 1: 4.7%Neural · Aug 2: 4.1%Neural · Aug 3: 4.4%Neural · Aug 4: 4.7%Neural · Aug 5: 4.1%TTS RT v1 · Jul 31: 3.8%TTS RT v1 · Aug 1: 4.4%TTS RT v1 · Aug 2: 3.7%TTS RT v1 · Aug 3: 4.1%TTS RT v1 · Aug 4: 3.6%TTS RT v1 · Aug 5: 3.5%TTS RT v1 · Aug 6: 3.8%TTS RT v1 · Aug 7: 3.7%TTS RT v1 · Aug 8: 4.9%TTS RT v1 · Aug 9: 3.8%TTS RT v1 · Aug 10: 4.0%TTS RT v1 · Aug 11: 4.4%TTS RT v1 · Aug 12: 4.4%TTS RT v1 · Aug 13: 3.0%TTS RT v1 · Aug 14: 4.5%TTS RT v1 · Aug 15: 3.3%TTS RT v1 · Aug 16: 4.3%TTS RT v1 · Aug 17: 3.7%TTS RT v1 · Aug 18: 3.7%TTS RT v1 · Aug 19: 3.7%TTS RT v1 · Aug 20: 4.5%TTS RT v1 · Aug 21: 3.3%TTS RT v1 · Aug 22: 4.2%TTS RT v1 · Aug 23: 3.7%TTS RT v1 · Aug 24: 3.8%TTS RT v1 · Aug 25: 4.4%TTS RT v1 · Aug 26: 4.1%TTS RT v1 · Aug 27: 3.5%TTS RT v1 · Aug 28: 3.9%TTS Rt v2 · Aug 10: 4.1%TTS Rt v2 · Aug 11: 4.5%TTS Rt v2 · Aug 12: 3.9%TTS Rt v2 · Aug 13: 3.9%TTS Rt v2 · Aug 14: 4.0%TTS Rt v2 · Aug 15: 3.4%TTS Rt v2 · Aug 16: 4.0%TTS Rt v2 · Aug 17: 3.7%TTS Rt v2 · Aug 18: 3.8%TTS Rt v2 · Aug 19: 4.3%TTS Rt v2 · Aug 20: 3.9%TTS Rt v2 · Aug 21: 4.2%TTS Rt v2 · Aug 22: 3.6%TTS Rt v2 · Aug 23: 4.4%TTS Rt v2 · Aug 24: 4.2%TTS Rt v2 · Aug 25: 3.7%TTS Rt v2 · Aug 26: 5.0%TTS Rt v2 · Aug 27: 3.6%TTS Rt v2 · Aug 28: 4.6%
Eleven v3 ConversationalLightning v3.1 ProNeuralTTS RT v1TTS Rt v2

About WER

Why it matters

Transcription errors can change names, numbers and intent before the text reaches the rest of a voice application. WER measures these errors at the word level.

Coval reports WER across clean speech, accents, intermittent noise, reverb, microphone distance, clipping, phone codecs and spontaneous speech because recognition accuracy varies by audio condition.

How Coval measures it

For speech-to-text, both the reference and the model transcript pass through Whisper's EnglishTextNormalizer before scoring. This prevents formatting differences, such as a written number versus the same number spelled out, from counting as recognition errors.

For text-to-speech, one fixed ASR model (OpenAI whisper-1) transcribes the generated audio. That transcript is compared with the input text as an intelligibility check. Errors from the fixed transcriber affect every TTS provider.

Caveats and interpretation

  • Reference quality and text normalization set a floor on absolute WER. Coval applies the same references and normalizer to every model in a category.
  • An overall WER can hide differences between clean speech, phone codecs and room acoustics. Dataset-level results show performance for each condition.

The datasets behind it

Every model runs the same fixed inputs, so a gap in WER is the model's doing — not the test's.

Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo