ELEVENLABSTEXT-TO-SPEECH45,616 SAMPLES / 30 DAYSLAST RUN SEP 15, 2026, 08:00 UTC

official resource

Eleven v3 Conversational text-to-speech benchmarks

Eleven v3 Conversational, hosted by ElevenLabs (Eleven Labs, 11Labs), measures mean 348 ms time to first audio (17th of 28) and 4.4% word error rate (4th of 28) among TTS systems. Results cover the last 30 days. Last measured .

Eleven v3 is ElevenLabs' expressive text-to-speech model, tuned for natural-sounding conversation rather than raw speed.

Time to First Audio#17 / 28
348ms
TTFA Network Roundtrip#19 / 28
259ms
TTFA Leading Silence#17 / 28
89ms
Word Error Rate#4 / 28
4.4%

Overview

Eleven v3 pairs multilingual synthesis with voice cloning and emotion controls for natural, expressive delivery.

Eleven v3 Conversational is tested every day on a fixed set of text prompts, measuring how quickly audible speech starts and how intelligible the result is.

Technical specifications

Made by
ElevenLabs
Hosted by
ElevenLabs
Source
Official API
Licensing
Proprietary
Deployment
Cloud
Region
US
Features
Emotion control, Multilingual, Voice cloning

How Eleven v3 Conversational ranks

Full TTS dashboard
Time to First Audio — every measured TTS modelMilliseconds · lower is better · 30-day averageEvery TTS model ranked on Time to First Audio, with Eleven v3 Conversational highlighted.
  1. #1vui66 ms
  2. #3TTS Flash 291 ms
  3. #4Qwen3 TTS 1.7b106 ms
  4. #6TTS 2181 ms
  5. #7Flash v2.5194 ms
  6. #8Default235 ms
  7. #9TTS Rt v2245 ms
  8. #10TTS RT v1245 ms
  9. #11Mist v3258 ms
  10. #12Sonic 3.5277 ms
  11. #14Aura 2308 ms
  12. #15Coda312 ms
  13. #16S2.1 Pro335 ms
Show all 28 models
  1. #19S1379 ms
  2. #20Grok TTS397 ms
  3. #21Sonic 3.6423 ms
  4. #22Simba 3.2451 ms
  5. #23Simba 3.0472 ms
  6. #24Chirp 3 HD535 ms
  7. #25Falcon 2545 ms
  8. #27S2.1 Pro Free964 ms
  9. #28GPT-4o mini TTS1013 ms
median of all models · 310 ms
TTS models over the last 30 days, ranked on Time to First Audio.
#ModelHostTTFAWERSamples
1vuiFluxions66 ms9,470
2Qwen3 TTS FastNari71 ms2,210
3TTS Flash 2Inworld AI91 ms11,421
4Qwen3 TTS 1.7bBaseten106 ms420
5Palabra TTS v1Palabra115 ms11,405
6TTS 2Inworld AI181 ms11,421
7Flash v2.5ElevenLabs194 ms9,138
8DefaultGradium235 ms9,147
9TTS Rt v2Soniox245 ms11,232
10TTS RT v1Soniox245 ms11,234
11Mist v3Rime258 ms11,407
12Sonic 3.5Cartesia277 ms11,420
13Phantom Z 3.4 conversationalDeepdub286 ms11,416
14Aura 2Deepgram308 ms11,406
15CodaRime312 ms11,412
16S2.1 ProFish Audio335 ms11,420
17Eleven v3 ConversationalElevenLabs348 ms11,409
18Lightning v3.1 ProSmallest362 ms11,421
19S1Fish Audio379 ms11,413
20Grok TTSxAI397 ms11,406
21Sonic 3.6Cartesia423 ms8,230
22Simba 3.2Speechify451 ms11,413
23Simba 3.0Speechify472 ms11,416
24Chirp 3 HDGoogle535 ms11,420
25Falcon 2Murf545 ms11,417
26Qwen3 TTS Flash RealtimeAlibaba753 ms11,246
27S2.1 Pro FreeFish Audio964 ms11,386
28GPT-4o mini TTSOpenAI1013 ms11,390
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Highest relative placement: 4th of 28 on Word Error Rate.

Latency vs accuracy

Where the errors come from

WER compositionEleven v3 Conversational's Word Error Rate split by error type · 30-day averageEleven v3 Conversational's WER split into substitutions, deletions and insertions.
  • Eleven v3 Conversational4.4%
SubstitutionsDeletionsInsertions

Averages and tail latency

Averages hide slow outliers — these are the distributions behind each figure.

Eleven v3 Conversational latency distributionMilliseconds · shared axis across metrics · last 30 daysEleven v3 Conversational's latency percentiles per metric: p25–p75 band, p50 tick, whisker to p99.
  • Time to First Audiop50 336 ms · p99 641 ms
  • TTFA Network Roundtripp50 245 ms · p99 573 ms
  • TTFA Leading Silencep50 95 ms · p99 188 ms
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops
Average and percentile values per metric, with the number of samples behind each row.
MetricAveragep25p50p75p90p95p99Samples
Time to First Audio348 ms308 ms336 ms372 ms412 ms445 ms641 ms11,409
TTFA Network Roundtrip259 ms207 ms245 ms292 ms335 ms368 ms573 ms11,409
TTFA Leading Silence89 ms47 ms95 ms116 ms137 ms154 ms188 ms11,409
Word Error Rate4.4%0.0%0.0%6.3%20.0%20.0%35.7%11,389

Last 30 days

Daily medians from the same measurement runs · gaps are days without qualifying runs.

Time to First Audio — daily p50Line p50 · band p25–p75 · UTC daysEleven v3 Conversational's daily median Time to First Audio over the last 30 days.
Eleven v3 Conversational · Sep 1: 352 msEleven v3 Conversational · Sep 2: 346 msEleven v3 Conversational · Sep 3: 318 msEleven v3 Conversational · Sep 4: 349 msEleven v3 Conversational · Sep 5: 316 msEleven v3 Conversational · Sep 6: 308 msEleven v3 Conversational · Sep 7: 323 msEleven v3 Conversational · Sep 8: 327 msEleven v3 Conversational · Sep 9: 326 msEleven v3 Conversational · Sep 10: 325 msEleven v3 Conversational · Sep 11: 326 msEleven v3 Conversational · Sep 12: 318 msEleven v3 Conversational · Sep 13: 315 msEleven v3 Conversational · Sep 14: 326 msEleven v3 Conversational · Sep 15: 315 ms
Word Error Rate — daily averageDaily average · UTC daysEleven v3 Conversational's daily Word Error Rate over the last 30 days.
Eleven v3 Conversational · Sep 1: 2.6%Eleven v3 Conversational · Sep 2: 3.8%Eleven v3 Conversational · Sep 3: 4.3%Eleven v3 Conversational · Sep 4: 4.2%Eleven v3 Conversational · Sep 5: 4.8%Eleven v3 Conversational · Sep 6: 5.3%Eleven v3 Conversational · Sep 7: 3.7%Eleven v3 Conversational · Sep 8: 4.5%Eleven v3 Conversational · Sep 9: 4.8%Eleven v3 Conversational · Sep 10: 4.8%Eleven v3 Conversational · Sep 11: 4.8%Eleven v3 Conversational · Sep 12: 4.6%Eleven v3 Conversational · Sep 13: 4.7%Eleven v3 Conversational · Sep 14: 4.3%Eleven v3 Conversational · Sep 15: 4.1%

Time to First Audio by dataset

Eleven v3 Conversational by test conditionMilliseconds · lower is better · best condition firstEleven v3 Conversational's Time to First Audio on each benchmark dataset.
Time to First Audio per dataset, with the number of samples behind each figure.
DatasetTTFASamples
Text prompts348 ms11,409

Strongest condition: Text prompts at 348 ms · weakest: Text prompts at 348 ms.

How fast is Eleven v3 Conversational?

On ElevenLabs, Eleven v3 Conversational measures mean 348 ms time to first audio (17th of 28). Last measured 2026-09-15.

How accurate is Eleven v3 Conversational?

On ElevenLabs, Eleven v3 Conversational measures 4.4% word error rate (4th of 28). Last measured 2026-09-15.

Who hosts Eleven v3 Conversational?

Eleven v3 Conversational is created by ElevenLabs and served by ElevenLabs. Coval measures each hosted endpoint separately.

Limits of this comparison

Eleven v3 receives the same prompts as other measured TTS models and has separate results from Eleven Flash.

  • Fixed prompts and WER do not capture the full expressiveness or conversational appropriateness the model targets.

Official sources

Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo