DATASETTTSCOVAL BENCHMARK ROTATIONACTIVE

manifest

tts-v2 text-to-speech benchmark dataset

tts-v2 is a text-to-speech test set in Coval's daily rotation — every measured text-to-speech model runs the same fixed inputs from it.

Items
0
fixed public inputs
Models measured
32
last 30 days
Current leader · TTFA#1 / 32
60ms
Defaultvia Gradium

How models rank on tts-v2

Full TTS dashboard
Time to First Audio on tts-v2Milliseconds · lower is better · 30-day average on this datasetEvery TTS model measured on the tts-v2 dataset, ranked on Time to First Audio.
  1. #1Default60 ms
  2. #2TTS Beta61 ms
  3. #4vui76 ms
  4. #5Simba 3.0112 ms
  5. #6Qwen3 TTS 1.7b112 ms
  6. #7TTS Flash 2117 ms
  7. #9Simba 3.2125 ms
  8. #10Flash v2.5189 ms
  9. #12Flux TTS207 ms
Show all 32 models
  1. #13TTS 2231 ms
  2. #14TTS RT v1254 ms
  3. #15TTS Rt v2255 ms
  4. #16Mist v3287 ms
  5. #17Sonic 3.5290 ms
  6. #18Aura 2293 ms
  7. #19Sonic 3.6305 ms
  8. #21Coda332 ms
  9. #23Falcon 2336 ms
  10. #24S2.1 Pro341 ms
  11. #25Grok TTS368 ms
  12. #27S1388 ms
  13. #28Aura 2 En573 ms
  14. #29Chirp 3 HD597 ms
  15. #31S2.1 Pro Free918 ms
  16. #32GPT-4o mini TTS2561 ms
median of all models · 288 ms
TTS models on the tts-v2 dataset over the last 30 days, ranked on Time to First Audio.
#ModelHostTTFAWERSamples
1DefaultGradium60 ms1,042
2Gradium TTS Beta 202609Gradium61 ms1,042
3Qwen3 TTS FastNari Labs68 ms1,042
4vuiFluxions76 ms872
5Simba 3.0SpeechifyAI112 ms1,041
6Qwen3 TTS 1.7bBaseten112 ms384
7TTS Flash 2Inworld AI117 ms846
8Palabra TTS v1Palabra118 ms865
9Simba 3.2SpeechifyAI125 ms1,038
10Flash v2.5ElevenLabs189 ms1,041
11Eleven v4 TurboElevenLabs202 ms352
12Flux TTSDeepgram207 ms934
13TTS 2Inworld AI231 ms846
14TTS RT v1Soniox254 ms888
15TTS Rt v2Soniox255 ms890
16Mist v3Rime287 ms602
17Sonic 3.5Cartesia290 ms1,042
18Aura 2Deepgram293 ms974
19Sonic 3.6Cartesia305 ms1,042
20Eleven v3 ConversationalElevenLabs325 ms1,041
21CodaRime332 ms602
22Phantom Z 3.4 conversationalDeepdub335 ms777
23Falcon 2Murf336 ms1,041
24S2.1 ProFish Audio341 ms1,042
25Grok TTSSpaceXAI368 ms1,039
26Lightning v3.1 ProSmallest379 ms1,042
27S1Fish Audio388 ms1,042
28Aura 2 EnCloudflare573 ms1,042
29Chirp 3 HDGoogle597 ms1,042
30Qwen3 TTS Flash RealtimeAlibaba709 ms1,041
31S2.1 Pro FreeFish Audio918 ms1,038
32GPT-4o mini TTSOpenAI2561 ms1,013
Under-sampled models are excluded; tied models share a place. Dotted WER values split into substitutions, deletions and insertions on hover or tap.

Inside the dataset

0 fixed public inputs — every model is tested on exactly these.

Source: Coval TTS v2 authoring bank (private); remote manifest also carries the tts-v1 prompts · License: Proprietary

Metrics reported for this dataset

Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo