ELEVENLABSSPEECH-TO-TEXT114,289 SAMPLES / 30 DAYSLAST RUN SEP 15, 2026, 08:00 UTC

official resource

Scribe v2 Realtime speech-to-text benchmarks

Scribe v2 Realtime, hosted by ElevenLabs (Eleven Labs, 11Labs), measures mean 133 ms time to final segment (12th of 28) and 5.5% word error rate (17th of 30) among STT systems. Results cover the last 30 days. Last measured .

Scribe v2 Realtime is ElevenLabs' streaming speech recognition model.

Word Error Rate#17 / 30
5.5%
Time to First Token#24 / 26
2175ms

Overview

ElevenLabs provides Scribe through a real-time transcription API with multilingual, voice-activity and keyterm support.

Scribe v2 Realtime is tested every day on fixed public audio — clean, accented, noisy, reverberant, far-field, clipped and phone-codec speech — for transcription accuracy and streaming latency.

Technical specifications

Made by
ElevenLabs
Hosted by
ElevenLabs
Source
Official API
Licensing
Proprietary
Deployment
Cloud
Region
US
Features
Keyterm biasing, Multilingual, VAD

How Scribe v2 Realtime ranks

Full STT dashboard
Time to Final Segment — every measured STT modelMilliseconds · lower is better · 30-day averageEvery STT model ranked on Time to Final Segment, with Scribe v2 Realtime highlighted.
  1. #1Qwen3 ASR 1.7b39 ms
  2. #3STT RT v557 ms
  3. #4STT 165 ms
  4. #6Nova 389 ms
  5. #7Nova 292 ms
  6. #9Flux99 ms
  7. #10Ink 2122 ms
  8. #11Whisper Large v3via Baseten125 ms
Show all 28 models
  1. #14Grok STT207 ms
  2. #15Defaultvia Speechmatics209 ms
  3. #16Pulse212 ms
  4. #17Defaultvia Gradium246 ms
  5. #18resonant-1264 ms
  6. #19Whisper Large v3via Together AI296 ms
  7. #20Enhanced299 ms
  8. #26Chirp 3776 ms
  9. #27Solaria 1805 ms
  10. #28Chirp 2873 ms
median of all models · 208 ms
STT models over the last 30 days, ranked on Time to Final Segment.
#ModelHostTTFSWERTTFTSamples
1Qwen3 ASR 1.7bBaseten39 ms931 ms1,256
2Qwen3 ASR FastNari46 ms1748 ms4,431
3STT RT v5Soniox57 ms1529 ms22,468
4STT 1Inworld AI65 ms1400 ms22,816
5Parakeet TDT 0.6B v3Together AI81 ms1215 ms22,468
6Nova 3Deepgram89 ms1418 ms22,835
7Nova 2Deepgram92 ms1419 ms22,713
8Flux MultilingualDeepgram98 ms1163 ms12,231
9FluxDeepgram99 ms1076 ms12,223
10Ink 2Cartesia122 ms1827 ms22,842
11Whisper Large v3Baseten125 ms912 ms1,252
12Scribe v2 RealtimeElevenLabs133 ms2175 ms22,846
13Universal 3.5 ProAssemblyAI173 ms1040 ms20,233
14Grok STTxAI207 ms22,833
15DefaultSpeechmatics209 ms1428 ms22,856
16PulseSmallest212 ms2011 ms22,836
17DefaultGradium246 ms1980 ms22,819
18resonant-1Reson8264 ms22,840
19Whisper Large v3Together AI296 ms1338 ms22,724
20EnhancedSpeechmatics299 ms1491 ms22,856
21Gemini 3.5 Transcribe LiveGemini305 ms1671 ms16,383
22Voxtral Mini Transcribe Realtime 2602Mistral400 ms1850 ms22,564
23GPT Realtime WhisperOpenAI551 ms1814 ms22,792
24GPT-4o mini TranscribeOpenAI690 ms22,810
25GPT-4o TranscribeOpenAI754 ms22,811
26Chirp 3Google776 ms5974 ms22,855
27Solaria 1Gladia805 ms1803 ms22,419
28Chirp 2Google873 ms6071 ms22,769
Nemotron 3.5 ASR StreamingTogether AI1548 ms22,727
Universal StreamingAssemblyAI1513 ms20,215
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Latency vs accuracy

Where the errors come from

WER compositionScribe v2 Realtime's Word Error Rate split by error type · 30-day averageScribe v2 Realtime's WER split into substitutions, deletions and insertions.
  • Scribe v2 Realtime5.5%
SubstitutionsDeletionsInsertions

Averages and tail latency

Averages hide slow outliers — these are the distributions behind each figure.

Scribe v2 Realtime latency distributionMilliseconds · shared axis across metrics · last 30 daysScribe v2 Realtime's latency percentiles per metric: p25–p75 band, p50 tick, whisker to p99.
  • Time to Final Segmentp50 126 ms · p99 291 ms
  • Time to First Tokenp50 2115 ms · p99 3162 ms
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops
Average and percentile values per metric, with the number of samples behind each row.
MetricAveragep25p50p75p90p95p99Samples
Time to Final Segment133 ms94 ms126 ms162 ms193 ms212 ms291 ms22,846
Word Error Rate5.5%0.0%0.0%6.9%14.3%23.1%50.0%22,883
Time to First Token2175 ms2074 ms2115 ms2175 ms2227 ms2913 ms3162 ms22,794

Last 30 days

Daily medians from the same measurement runs · gaps are days without qualifying runs.

Time to Final Segment — daily p50Line p50 · band p25–p75 · UTC daysScribe v2 Realtime's daily median Time to Final Segment over the last 30 days.
Scribe v2 Realtime · Sep 1: 108 msScribe v2 Realtime · Sep 2: 135 msScribe v2 Realtime · Sep 3: 133 msScribe v2 Realtime · Sep 4: 129 msScribe v2 Realtime · Sep 5: 104 msScribe v2 Realtime · Sep 6: 97 msScribe v2 Realtime · Sep 7: 138 msScribe v2 Realtime · Sep 8: 140 msScribe v2 Realtime · Sep 9: 133 msScribe v2 Realtime · Sep 10: 134 msScribe v2 Realtime · Sep 11: 133 msScribe v2 Realtime · Sep 12: 103 msScribe v2 Realtime · Sep 13: 99 msScribe v2 Realtime · Sep 14: 139 msScribe v2 Realtime · Sep 15: 143 ms
Word Error Rate — daily averageDaily average · UTC daysScribe v2 Realtime's daily Word Error Rate over the last 30 days.
Scribe v2 Realtime · Sep 1: 4.7%Scribe v2 Realtime · Sep 2: 5.7%Scribe v2 Realtime · Sep 3: 5.8%Scribe v2 Realtime · Sep 4: 6.0%Scribe v2 Realtime · Sep 5: 5.9%Scribe v2 Realtime · Sep 6: 6.4%Scribe v2 Realtime · Sep 7: 6.5%Scribe v2 Realtime · Sep 8: 5.8%Scribe v2 Realtime · Sep 9: 6.6%Scribe v2 Realtime · Sep 10: 5.9%Scribe v2 Realtime · Sep 11: 5.8%Scribe v2 Realtime · Sep 12: 5.4%Scribe v2 Realtime · Sep 13: 6.1%Scribe v2 Realtime · Sep 14: 6.6%Scribe v2 Realtime · Sep 15: 7.0%

Time to Final Segment by dataset

Scribe v2 Realtime by test conditionMilliseconds · lower is better · best condition firstScribe v2 Realtime's Time to Final Segment on each benchmark dataset.
Time to Final Segment per dataset, with the number of samples behind each figure.
DatasetTTFSSamples
LibriSpeech85 ms1
ProductionPipeCat132 ms11,507
AccentsWildASR131 ms1,116
CleanWildASR134 ms4,572
ClippingWildASR134 ms1,136
Far-fieldWildASR135 ms1,141
Noise gapsWildASR136 ms1,141
Phone codecWildASR135 ms1,137
ReverbWildASR135 ms1,095

Strongest condition: LibriSpeech at 85 ms · weakest: WildASR noise gaps at 136 ms.

How fast is Scribe v2 Realtime?

On ElevenLabs, Scribe v2 Realtime measures mean 133 ms time to final segment (12th of 28) and mean 2175 ms time to first token (24th of 26). Last measured 2026-09-15.

How accurate is Scribe v2 Realtime?

On ElevenLabs, Scribe v2 Realtime measures 5.5% word error rate (17th of 30). Last measured 2026-09-15.

Who hosts Scribe v2 Realtime?

Scribe v2 Realtime is created by ElevenLabs and served by ElevenLabs. Coval measures each hosted endpoint separately.

Limits of this comparison

Scribe is measured separately from ElevenLabs synthesis models, focusing on transcript errors and streaming timing.

  • The benchmark does not score every language, speaker-labeling mode or event type offered by Scribe.

Official sources

Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo