DEEPGRAMTEXT-TO-SPEECH51,274 SAMPLES / 30 DAYSLAST RUN AUG 28, 2026, 21:30 UTC

official resource

Aura 2 text-to-speech benchmarks

Aura 2 is Deepgram's real-time text-to-speech model, measured here with its Thalia English voice.

Time to First Audio#13 / 30
328ms
TTFA Network Roundtrip#7 / 28
133ms
TTFA Leading Silence#25 / 28
192ms
Word Error Rate#22 / 30
5.3%

Overview

Aura 2 streams synthesis over Deepgram's real-time API, and voice choice can affect startup silence and intelligibility.

Aura 2 is tested every day on a fixed set of text prompts, measuring how quickly audible speech starts and how intelligible the result is.

Technical specifications

Made by
Deepgram
Hosted by
Deepgram
Source
Official API
Licensing
Proprietary
Deployment
On-prem
Region
US

How Aura 2 ranks

Full TTS dashboard
Time to First Audio — every measured TTS modelMilliseconds · lower is better · 30-day averageEvery TTS model ranked on Time to First Audio, with Aura 2 highlighted.
  1. #2vui124 ms
  2. #3TTS Flash 2128 ms
  3. #4TTS 2176 ms
  4. #5Blizzard235 ms
  5. #6Neural236 ms
  6. #7Mist v3256 ms
  7. #8TTS Rt v2262 ms
  8. #9Sonic 3.5274 ms
  9. #10TTS RT v1275 ms
  10. #12Coda313 ms
  11. #13Aura 2328 ms
Show all 30 models
  1. #14S2.1 Pro374 ms
  2. #15Default384 ms
  3. #18Grok TTS420 ms
  4. #19S1434 ms
  5. #20Flash v2.5455 ms
  6. #21Speech 2.8 HD460 ms
  7. #22Sonic 3.6466 ms
  8. #23Simba 3.2484 ms
  9. #24Chirp 3 HD512 ms
  10. #25Simba 3.0526 ms
  11. #26Falcon 2549 ms
  12. #29S2.1 Pro Free806 ms
  13. #30GPT-4o mini TTS1075 ms
median of all models · 397 ms
TTS models over the last 30 days, ranked on Time to First Audio.
#ModelHostTTFAWERSamples
1Palabra TTS v1Palabra116 ms5.9%14,396
2vuiFluxions124 ms8,624
3TTS Flash 2Inworld AI128 ms8,719
4TTS 2Inworld AI176 ms4.8%14,529
5BlizzardLmnt235 ms7.4%14,117
6NeuralAzure236 ms4.3%3,350
7Mist v3Rime256 ms6.3%14,524
8TTS Rt v2Soniox262 ms8,849
9Sonic 3.5Cartesia274 ms6.1%14,513
10TTS RT v1Soniox275 ms3.7%14,528
11Dragon HD LatestAzure310 ms5.1%3,350
12CodaRime313 ms5.2%14,523
13Aura 2Deepgram328 ms5.3%14,501
14S2.1 ProFish Audio374 ms10,222
15DefaultGradium384 ms4.6%14,002
16Speech 2.8 TurboMiniMax411 ms4.8%1,997
17Eleven v3 ConversationalElevenLabs412 ms6,750
18Grok TTSxAI420 ms4.7%14,524
19S1Fish Audio434 ms4.9%10,236
20Flash v2.5ElevenLabs455 ms6.7%9,259
21Speech 2.8 HDMiniMax460 ms1,995
22Sonic 3.6Cartesia466 ms560
23Simba 3.2Speechify484 ms4.7%14,525
24Chirp 3 HDGoogle512 ms5.2%14,530
25Simba 3.0Speechify526 ms5.3%14,526
26Falcon 2Murf549 ms10,229
27Lightning v3.1 ProSmallest586 ms4.4%14,515
28Qwen3 TTS Flash RealtimeAlibaba645 ms8.8%14,530
29S2.1 Pro FreeFish Audio806 ms4.7%14,464
30GPT-4o mini TTSOpenAI1075 ms4.8%14,517
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Latency vs accuracy

Averages and tail latency

Averages hide slow outliers — these are the distributions behind each figure.

Aura 2 latency distributionMilliseconds · shared axis across metrics · last 30 daysAura 2's latency percentiles per metric: p25–p75 band, p50 tick, whisker to p99.
  • Time to First Audiop50 310 ms · p99 592 ms
  • TTFA Network Roundtripp50 135 ms · p99 184 ms
  • TTFA Leading Silencep50 167 ms · p99 450 ms
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops
Average and percentile values per metric, with the number of samples behind each row.
MetricAveragep25p50p75p90p95p99Samples
Time to First Audio328 ms217 ms310 ms437 ms504 ms542 ms592 ms14,501
TTFA Network Roundtrip133 ms124 ms135 ms143 ms152 ms163 ms184 ms11,136
TTFA Leading Silence192 ms85 ms167 ms305 ms369 ms404 ms450 ms11,136
Word Error Rate5.3%0.0%0.0%7.1%20.0%28.0%48.0%14,501

Last 30 days

Daily medians from the same measurement runs · gaps are days without qualifying runs.

Time to First Audio — daily p50Line p50 · band p25–p75 · UTC daysAura 2's daily median Time to First Audio over the last 30 days.
Aura 2 · Jul 31: 393 msAura 2 · Aug 1: 264 msAura 2 · Aug 2: 327 msAura 2 · Aug 3: 334 msAura 2 · Aug 4: 376 msAura 2 · Aug 5: 255 msAura 2 · Aug 6: 441 msAura 2 · Aug 7: 256 msAura 2 · Aug 8: 400 msAura 2 · Aug 9: 291 msAura 2 · Aug 10: 319 msAura 2 · Aug 11: 339 msAura 2 · Aug 12: 376 msAura 2 · Aug 13: 260 msAura 2 · Aug 14: 257 msAura 2 · Aug 15: 350 msAura 2 · Aug 16: 406 msAura 2 · Aug 17: 244 msAura 2 · Aug 18: 319 msAura 2 · Aug 19: 314 msAura 2 · Aug 20: 333 msAura 2 · Aug 21: 310 msAura 2 · Aug 22: 404 msAura 2 · Aug 23: 205 msAura 2 · Aug 24: 268 msAura 2 · Aug 25: 250 msAura 2 · Aug 26: 375 msAura 2 · Aug 27: 354 msAura 2 · Aug 28: 307 ms
Word Error Rate — daily averageDaily average · UTC daysAura 2's daily Word Error Rate over the last 30 days.
Aura 2 · Jul 31: 5.9%Aura 2 · Aug 1: 5.9%Aura 2 · Aug 2: 5.3%Aura 2 · Aug 3: 6.1%Aura 2 · Aug 4: 6.6%Aura 2 · Aug 5: 5.8%Aura 2 · Aug 6: 6.3%Aura 2 · Aug 7: 5.3%Aura 2 · Aug 8: 6.0%Aura 2 · Aug 9: 5.9%Aura 2 · Aug 10: 5.8%Aura 2 · Aug 11: 5.2%Aura 2 · Aug 12: 6.8%Aura 2 · Aug 13: 5.4%Aura 2 · Aug 14: 5.5%Aura 2 · Aug 15: 5.9%Aura 2 · Aug 16: 5.8%Aura 2 · Aug 17: 6.1%Aura 2 · Aug 18: 6.0%Aura 2 · Aug 19: 5.2%Aura 2 · Aug 20: 7.9%Aura 2 · Aug 21: 5.5%Aura 2 · Aug 22: 6.6%Aura 2 · Aug 23: 5.0%Aura 2 · Aug 24: 5.9%Aura 2 · Aug 25: 5.0%Aura 2 · Aug 26: 7.2%Aura 2 · Aug 27: 5.2%Aura 2 · Aug 28: 5.8%

Time to First Audio by dataset

Aura 2 by test conditionMilliseconds · lower is better · best condition firstAura 2's Time to First Audio on each benchmark dataset.
Time to First Audio per dataset, with the number of samples behind each figure.
DatasetTTFASamples
Text prompts328 ms14,501

Strongest condition: Text prompts at 328 ms · weakest: Text prompts at 328 ms.

Limits of this comparison

Results apply specifically to this voice because voice choice can affect leading silence and intelligibility.

  • One voice cannot represent every Aura voice, language or speaking style, so the results stay attached to Thalia English.

Official sources

Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo