DEEPDUBTEXT-TO-SPEECH40,164 SAMPLES / 30 DAYSLAST RUN SEP 4, 2026, 20:30 UTC
Phantom Z 3.4 conversational text-to-speech benchmarks
Coval has active text-to-speech measurements for Phantom Z 3.4 conversational, created by Deepdub and served through Deepdub's own API.
- Time to First Audio#10 / 26
- 302ms
- TTFA Network Roundtrip#15 / 26
- 257ms
- TTFA Leading Silence#9 / 26
- 45ms
- Word Error Rate#23 / 26
- 6.3%
Overview
Phantom Z 3.4 conversational is tested every day on a fixed set of text prompts, measuring how quickly audible speech starts and how intelligible the result is.
How Phantom Z 3.4 conversational ranks
Full TTS dashboardShow all 26 modelsShow fewer
Show all 26 modelsShow fewer
| # | Model | Host | TTFA | WER | Samples |
|---|---|---|---|---|---|
| 1 | vui | Fluxions | 110 ms | 10,720 | |
| 2 | Palabra TTS v1 | Palabra | 116 ms | 13,690 | |
| 3 | TTS Flash 2 | Inworld AI | 118 ms | 11,379 | |
| 4 | TTS 2 | Inworld AI | 176 ms | 13,828 | |
| 5 | Default | Gradium | 236 ms | 4,137 | |
| 6 | Mist v3 | Rime | 257 ms | 13,824 | |
| 7 | TTS Rt v2 | Soniox | 258 ms | 11,509 | |
| 8 | TTS RT v1 | Soniox | 264 ms | 13,829 | |
| 9 | Sonic 3.5 | Cartesia | 274 ms | 13,828 | |
| 10 | Phantom Z 3.4 conversational | Deepdub | 302 ms | 10,041 | |
| 11 | Coda | Rime | 319 ms | 13,819 | |
| 12 | Aura 2 | Deepgram | 322 ms | 13,803 | |
| 13 | Flash v2.5 | ElevenLabs | 357 ms | 8,559 | |
| 14 | S2.1 Pro | Fish Audio | 363 ms | 12,882 | |
| 15 | Eleven v3 Conversational | ElevenLabs | 396 ms | 9,410 | |
| 16 | Grok TTS | xAI | 417 ms | 13,823 | |
| 17 | S1 | Fish Audio | 421 ms | 12,893 | |
| 18 | Simba 3.2 | Speechify | 447 ms | 13,821 | |
| 19 | Lightning v3.1 Pro | Smallest | 463 ms | 13,814 | |
| 20 | Sonic 3.6 | Cartesia | 465 ms | 3,220 | |
| 21 | Simba 3.0 | Speechify | 469 ms | 13,825 | |
| 22 | Chirp 3 HD | 518 ms | 13,829 | ||
| 23 | Falcon 2 | Murf | 549 ms | 12,885 | |
| 24 | Qwen3 TTS Flash Realtime | Alibaba | 685 ms | 13,791 | |
| 25 | S2.1 Pro Free | Fish Audio | 902 ms | 13,773 | |
| 26 | GPT-4o mini TTS | OpenAI | 1033 ms | 13,816 |
Latency vs accuracy
Where the errors come from
- Phantom Z 3.4 conversational6.3%
Averages and tail latency
Averages hide slow outliers — these are the distributions behind each figure.
- Time to First Audiop50 269 ms · p99 778 ms
- TTFA Network Roundtripp50 231 ms · p99 755 ms
- TTFA Leading Silencep50 26 ms · p99 333 ms
- Phantom Z 3.4 conversationalp50 0.0% · p99 76.0%
| Metric | Average | p25 | p50 | p75 | p90 | p95 | p99 | Samples |
|---|---|---|---|---|---|---|---|---|
| Time to First Audio | 302 ms | 243 ms | 269 ms | 311 ms | 402 ms | 531 ms | 778 ms | 10,041 |
| TTFA Network Roundtrip | 257 ms | 216 ms | 231 ms | 260 ms | 302 ms | 386 ms | 755 ms | 10,041 |
| TTFA Leading Silence | 45 ms | 15 ms | 26 ms | 42 ms | 99 ms | 155 ms | 333 ms | 10,041 |
| Word Error Rate | 6.3% | 0.0% | 0.0% | 7.7% | 20.0% | 28.0% | 76.0% | 10,041 |
Last 30 days
Daily medians from the same measurement runs · gaps are days without qualifying runs.
Time to First Audio by dataset
- Text prompts302 ms
| Dataset | TTFA | Samples |
|---|---|---|
| Text prompts | 302 ms | 10,041 |
Strongest condition: Text prompts at 302 ms · weakest: Text prompts at 302 ms.
Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.
Evaluate your own voice agent
Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.