ELEVENLABSTEXT-TO-SPEECH27,000 SAMPLES / 30 DAYSLAST RUN AUG 28, 2026, 21:30 UTC
Eleven v3 Conversational text-to-speech benchmarks
Eleven v3 is ElevenLabs' expressive text-to-speech model, tuned for natural-sounding conversation rather than raw speed.
- Time to First Audio#17 / 30
- 412ms
- TTFA Network Roundtrip#18 / 28
- 324ms
- TTFA Leading Silence#14 / 28
- 88ms
- Word Error Rate#4 / 30
- 4.4%
Overview
Eleven v3 pairs multilingual synthesis with voice cloning and emotion controls for natural, expressive delivery.
Eleven v3 Conversational is tested every day on a fixed set of text prompts, measuring how quickly audible speech starts and how intelligible the result is.
Technical specifications
- Made by
- ElevenLabs
- Hosted by
- ElevenLabs
- Source
- Official API
- Licensing
- Proprietary
- Deployment
- Cloud
- Region
- US
- Features
- Multilingual, Voice cloning, Emotion control
How Eleven v3 Conversational ranks
Full TTS dashboard- #15Default384 ms
Show all 30 modelsShow fewer
- #6Default4.6%
Show all 30 modelsShow fewer
| # | Model | Host | TTFA | WER | Samples |
|---|---|---|---|---|---|
| 1 | Palabra TTS v1 | Palabra | 116 ms | 5.9% | 14,396 |
| 2 | vui | Fluxions | 124 ms | 8,624 | |
| 3 | TTS Flash 2 | Inworld AI | 128 ms | 8,719 | |
| 4 | TTS 2 | Inworld AI | 176 ms | 4.8% | 14,529 |
| 5 | Blizzard | Lmnt | 235 ms | 7.4% | 14,117 |
| 6 | Neural | Azure | 236 ms | 4.3% | 3,350 |
| 7 | Mist v3 | Rime | 256 ms | 6.3% | 14,524 |
| 8 | TTS Rt v2 | Soniox | 262 ms | 8,849 | |
| 9 | Sonic 3.5 | Cartesia | 274 ms | 6.1% | 14,513 |
| 10 | TTS RT v1 | Soniox | 275 ms | 3.7% | 14,528 |
| 11 | Dragon HD Latest | Azure | 310 ms | 5.1% | 3,350 |
| 12 | Coda | Rime | 313 ms | 5.2% | 14,523 |
| 13 | Aura 2 | Deepgram | 328 ms | 5.3% | 14,501 |
| 14 | S2.1 Pro | Fish Audio | 374 ms | 10,222 | |
| 15 | Default | Gradium | 384 ms | 4.6% | 14,002 |
| 16 | Speech 2.8 Turbo | MiniMax | 411 ms | 4.8% | 1,997 |
| 17 | Eleven v3 Conversational | ElevenLabs | 412 ms | 6,750 | |
| 18 | Grok TTS | xAI | 420 ms | 4.7% | 14,524 |
| 19 | S1 | Fish Audio | 434 ms | 4.9% | 10,236 |
| 20 | Flash v2.5 | ElevenLabs | 455 ms | 6.7% | 9,259 |
| 21 | Speech 2.8 HD | MiniMax | 460 ms | 1,995 | |
| 22 | Sonic 3.6 | Cartesia | 466 ms | 560 | |
| 23 | Simba 3.2 | Speechify | 484 ms | 4.7% | 14,525 |
| 24 | Chirp 3 HD | 512 ms | 5.2% | 14,530 | |
| 25 | Simba 3.0 | Speechify | 526 ms | 5.3% | 14,526 |
| 26 | Falcon 2 | Murf | 549 ms | 10,229 | |
| 27 | Lightning v3.1 Pro | Smallest | 586 ms | 4.4% | 14,515 |
| 28 | Qwen3 TTS Flash Realtime | Alibaba | 645 ms | 8.8% | 14,530 |
| 29 | S2.1 Pro Free | Fish Audio | 806 ms | 4.7% | 14,464 |
| 30 | GPT-4o mini TTS | OpenAI | 1075 ms | 4.8% | 14,517 |
Highest relative placement: 4th of 30 on Word Error Rate.
Latency vs accuracy
Where the errors come from
- Eleven v3 Conversational4.4%
Averages and tail latency
Averages hide slow outliers — these are the distributions behind each figure.
- Time to First Audiop50 390 ms · p99 794 ms
- TTFA Network Roundtripp50 297 ms · p99 693 ms
- TTFA Leading Silencep50 94 ms · p99 188 ms
- Eleven v3 Conversationalp50 0.0% · p99 35.7%
| Metric | Average | p25 | p50 | p75 | p90 | p95 | p99 | Samples |
|---|---|---|---|---|---|---|---|---|
| Time to First Audio | 412 ms | 340 ms | 390 ms | 464 ms | 529 ms | 580 ms | 794 ms | 6,750 |
| TTFA Network Roundtrip | 324 ms | 264 ms | 297 ms | 360 ms | 418 ms | 471 ms | 693 ms | 6,750 |
| TTFA Leading Silence | 88 ms | 46 ms | 94 ms | 116 ms | 137 ms | 153 ms | 188 ms | 6,750 |
| Word Error Rate | 4.4% | 0.0% | 0.0% | 6.3% | 20.0% | 20.0% | 35.7% | 6,750 |
Last 30 days
Daily medians from the same measurement runs · gaps are days without qualifying runs.
Time to First Audio by dataset
- Text prompts412 ms
| Dataset | TTFA | Samples |
|---|---|---|
| Text prompts | 412 ms | 6,750 |
Strongest condition: Text prompts at 412 ms · weakest: Text prompts at 412 ms.
Limits of this comparison
Eleven v3 receives the same prompts as other measured TTS models and has separate results from Eleven Flash.
- Fixed prompts and WER do not capture the full expressiveness or conversational appropriateness the model targets.
Official sources
- ElevenLabs model documentation (documentation)
Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.
Evaluate your own voice agent
Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.