ELEVENLABSTEXT-TO-SPEECH1,472 SAMPLES / 30 DAYSLAST RUN OCT 5, 2026, 17:30 UTC

Eleven v4 Turbo text-to-speech benchmarks

Eleven v4 Turbo, hosted by ElevenLabs (Eleven Labs, 11Labs), measures mean 203 ms time to first audio (9th of 32) and 1.8% word error rate (1st of 32) among TTS systems. Results cover the last 30 days. Last measured .

Coval has active text-to-speech measurements for Eleven v4 Turbo, created by ElevenLabs and served through ElevenLabs's own API.

TTFA Network Roundtrip#11 / 32
142ms
TTFA Leading Silence#16 / 32
61ms
Word Error Rate#1 / 32
1.8%

Overview

Eleven v4 Turbo is tested every day on a fixed set of text prompts, measuring how quickly audible speech starts and how intelligible the result is.

Technical specifications

Made by
ElevenLabs
Hosted by
ElevenLabs
Source
Official API
Licensing
Proprietary
Deployment
Cloud
Region
US
Features
Emotion control, Multilingual, Voice cloning

How Eleven v4 Turbo ranks

Full TTS dashboard
Time to First Audio — every measured TTS modelMilliseconds · lower is better · 30-day averageEvery TTS model ranked on Time to First Audio, with Eleven v4 Turbo highlighted.
  1. #1vui54 ms
  2. #2TTS Beta54 ms
  3. #4TTS Flash 283 ms
  4. #5Qwen3 TTS 1.7b109 ms
  5. #7TTS 2183 ms
  6. #8Flash v2.5188 ms
  7. #10Default207 ms
  8. #11Flux TTS209 ms
  9. #12TTS Rt v2256 ms
Show all 32 models
  1. #13TTS RT v1258 ms
  2. #14Mist v3260 ms
  3. #16Sonic 3.5285 ms
  4. #17Simba 3.2286 ms
  5. #18Coda298 ms
  6. #19Aura 2301 ms
  7. #20Simba 3.0302 ms
  8. #22S2.1 Pro343 ms
  9. #23Sonic 3.6353 ms
  10. #25S1382 ms
  11. #26Grok TTS398 ms
  12. #27Falcon 2521 ms
  13. #28Chirp 3 HD545 ms
  14. #29Aura 2 En550 ms
  15. #31S2.1 Pro Free1004 ms
  16. #32GPT-4o mini TTS1186 ms
median of all models · 286 ms
TTS models over the last 30 days, ranked on Time to First Audio.
#ModelHostTTFAWERSamples
1vuiFluxions54 ms9,380
2Gradium TTS Beta 202609Gradium54 ms5,108
3Qwen3 TTS FastNari Labs70 ms7,495
4TTS Flash 2Inworld AI83 ms9,692
5Qwen3 TTS 1.7bBaseten109 ms1,045
6Palabra TTS v1Palabra115 ms9,645
7TTS 2Inworld AI183 ms9,689
8Flash v2.5ElevenLabs188 ms9,873
9Eleven v4 TurboElevenLabs203 ms368
10DefaultGradium207 ms9,878
11Flux TTSDeepgram209 ms9,776
12TTS Rt v2Soniox256 ms8,076
13TTS RT v1Soniox258 ms8,076
14Mist v3Rime260 ms9,432
15Phantom Z 3.4 conversationalDeepdub273 ms9,618
16Sonic 3.5Cartesia285 ms9,888
17Simba 3.2SpeechifyAI286 ms9,868
18CodaRime298 ms9,432
19Aura 2Deepgram301 ms9,816
20Simba 3.0SpeechifyAI302 ms9,875
21Eleven v3 ConversationalElevenLabs325 ms9,873
22S2.1 ProFish Audio343 ms9,887
23Sonic 3.6Cartesia353 ms9,888
24Lightning v3.1 ProSmallest365 ms9,888
25S1Fish Audio382 ms9,884
26Grok TTSSpaceXAI398 ms9,861
27Falcon 2Murf521 ms9,886
28Chirp 3 HDGoogle545 ms9,888
29Aura 2 EnCloudflare550 ms1,528
30Qwen3 TTS Flash RealtimeAlibaba687 ms9,577
31S2.1 Pro FreeFish Audio1004 ms9,860
32GPT-4o mini TTSOpenAI1186 ms9,809
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Highest relative placement: 1st of 32 on Word Error Rate.

Latency vs accuracy

Where the errors come from

WER compositionEleven v4 Turbo's Word Error Rate split by error type · 30-day averageEleven v4 Turbo's WER split into substitutions, deletions and insertions.
  • Eleven v4 Turbo1.8%
SubstitutionsDeletionsInsertions

Averages and tail latency

Averages hide slow outliers — these are the distributions behind each figure.

Eleven v4 Turbo latency distributionMilliseconds · shared axis across metrics · last 30 daysEleven v4 Turbo's latency percentiles per metric: p25–p75 band, p50 tick, whisker to p99.
  • Time to First Audiop50 194 ms · p99 445 ms
  • TTFA Network Roundtripp50 128 ms · p99 397 ms
  • TTFA Leading Silencep50 62 ms · p99 113 ms
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops
Average and percentile values per metric, with the number of samples behind each row.
MetricAveragep25p50p75p90p95p99Samples
Time to First Audio203 ms175 ms194 ms210 ms232 ms254 ms445 ms368
TTFA Network Roundtrip142 ms121 ms128 ms145 ms160 ms188 ms397 ms368
TTFA Leading Silence61 ms48 ms62 ms74 ms81 ms86 ms113 ms368
Word Error Rate1.8%0.0%0.0%2.3%8.9%15.0%23.9%368

Last 30 days

Daily medians from the same measurement runs · gaps are days without qualifying runs.

Time to First Audio — daily p50Line p50 · band p25–p75 · UTC daysEleven v4 Turbo's daily median Time to First Audio over the last 30 days.
Eleven v4 Turbo · Oct 1: 191 msEleven v4 Turbo · Oct 2: 191 msEleven v4 Turbo · Oct 3: 199 msEleven v4 Turbo · Oct 4: 199 msEleven v4 Turbo · Oct 5: 192 ms
Word Error Rate — daily averageDaily average · UTC daysEleven v4 Turbo's daily Word Error Rate over the last 30 days.
Eleven v4 Turbo · Oct 1: 4.0%Eleven v4 Turbo · Oct 2: 2.7%Eleven v4 Turbo · Oct 3: 2.8%Eleven v4 Turbo · Oct 4: 3.3%Eleven v4 Turbo · Oct 5: 1.5%

Time to First Audio by dataset

Eleven v4 Turbo by test conditionMilliseconds · lower is better · best condition firstEleven v4 Turbo's Time to First Audio on each benchmark dataset.
  1. tts-v2203 ms
Time to First Audio per dataset, with the number of samples behind each figure.
DatasetTTFASamples
tts-v2203 ms368

Strongest condition: tts-v2 at 203 ms · weakest: tts-v2 at 203 ms.

How fast is Eleven v4 Turbo?

On ElevenLabs, Eleven v4 Turbo measures mean 203 ms time to first audio (9th of 32). Last measured 2026-10-05.

How accurate is Eleven v4 Turbo?

On ElevenLabs, Eleven v4 Turbo measures 1.8% word error rate (1st of 32). Last measured 2026-10-05.

Who hosts Eleven v4 Turbo?

Eleven v4 Turbo is created by ElevenLabs and served by ElevenLabs. Coval measures each hosted endpoint separately.

Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo