OPENAISPEECH-TO-SPEECH1,937 SAMPLES / 30 DAYSLAST RUN AUG 27, 2026, 00:00 UTC

official resource

GPT Realtime 2 speech-to-speech benchmarks

GPT Realtime is OpenAI's end-to-end model for low-latency audio conversations.

Overview

The Realtime API accepts and emits audio within a persistent session; latency here is the pause a caller actually hears, taken from the call recording.

Instruction adherence is scored from the same simulated calls as voice-to-voice latency.

GPT Realtime 2 is tested on multi-turn simulated phone calls, measuring the pause before each reply and how closely it follows its instructions.

Technical specifications

Made by
OpenAI
Hosted by
OpenAI
Source
Official API
Licensing
Proprietary
Deployment
Cloud
Region
US
Features
Multilingual

How GPT Realtime 2 ranks

Full S2S dashboard
Voice-to-Voice Latency — every measured S2S modelMilliseconds · lower is better · 30-day averageEvery S2S model ranked on Voice-to-Voice Latency, with GPT Realtime 2 highlighted.
median of all models · 1343 ms
S2S models over the last 30 days, ranked on Voice-to-Voice Latency.
#ModelHostV2VInstructionSamples
1GPT Realtime 2OpenAI1306 ms71%838
2Gemini 3.1 Flash Live (Preview)Google1380 ms76%834
Under-sampled models are excluded; tied models share a place.

Latency vs accuracy

V2V vs InstructionEach point is one measured model · GPT Realtime 2 highlighted · 30-day averagesVoice-to-Voice Latency against Instruction Adherence for every measured S2S model, with GPT Realtime 2 highlighted.
Gemini 3.1 Flash Live (Preview) — 1380 ms, 76%GPT Realtime 2 — 1306 ms, 71%

Averages and tail latency

Averages hide slow outliers — these are the distributions behind each figure.

GPT Realtime 2 latency distributionMilliseconds · shared axis across metrics · last 30 daysGPT Realtime 2's latency percentiles per metric: p25–p75 band, p50 tick, whisker to p99.
  • Voice-to-Voice Latencyp50 1267 ms · p99 1957 ms
band p25–p75 · tick p50 · whisker to p99 with p90 and p95 stops
Average and percentile values per metric, with the number of samples behind each row.
MetricAveragep25p50p75p90p95p99Samples
Voice-to-Voice Latency1306 ms1140 ms1267 ms1433 ms1600 ms1693 ms1957 ms838
Instruction Adherence71%0%100%100%100%100%100%801

Last 30 days

Daily medians from the same measurement runs · gaps are days without qualifying runs.

Voice-to-Voice Latency — daily p50Line p50 · band p25–p75 · UTC daysGPT Realtime 2's daily median Voice-to-Voice Latency over the last 30 days.
GPT Realtime 2 · Jul 31: 1,167 msGPT Realtime 2 · Aug 1: 1,244 msGPT Realtime 2 · Aug 2: 1,253 msGPT Realtime 2 · Aug 3: 1,260 msGPT Realtime 2 · Aug 4: 1,413 msGPT Realtime 2 · Aug 5: 1,383 msGPT Realtime 2 · Aug 6: 1,192 msGPT Realtime 2 · Aug 7: 1,183 msGPT Realtime 2 · Aug 8: 1,200 msGPT Realtime 2 · Aug 9: 1,190 msGPT Realtime 2 · Aug 10: 1,210 msGPT Realtime 2 · Aug 11: 1,220 msGPT Realtime 2 · Aug 12: 1,237 msGPT Realtime 2 · Aug 13: 1,217 msGPT Realtime 2 · Aug 14: 1,270 msGPT Realtime 2 · Aug 16: 1,229 msGPT Realtime 2 · Aug 17: 1,245 msGPT Realtime 2 · Aug 18: 1,263 msGPT Realtime 2 · Aug 19: 1,267 msGPT Realtime 2 · Aug 20: 1,223 msGPT Realtime 2 · Aug 21: 1,345 msGPT Realtime 2 · Aug 22: 1,327 msGPT Realtime 2 · Aug 23: 1,367 msGPT Realtime 2 · Aug 24: 1,420 msGPT Realtime 2 · Aug 25: 1,483 msGPT Realtime 2 · Aug 26: 1,413 msGPT Realtime 2 · Aug 27: 1,300 ms
Instruction Adherence — daily averageDaily average · UTC daysGPT Realtime 2's daily Instruction Adherence over the last 30 days.
GPT Realtime 2 · Jul 31: 93.3%GPT Realtime 2 · Aug 1: 93.3%GPT Realtime 2 · Aug 2: 100.0%GPT Realtime 2 · Aug 3: 96.7%GPT Realtime 2 · Aug 4: 96.6%GPT Realtime 2 · Aug 5: 92.9%GPT Realtime 2 · Aug 6: 83.3%GPT Realtime 2 · Aug 7: 93.3%GPT Realtime 2 · Aug 8: 83.3%GPT Realtime 2 · Aug 9: 90.0%GPT Realtime 2 · Aug 10: 100.0%GPT Realtime 2 · Aug 11: 92.9%GPT Realtime 2 · Aug 12: 80.0%GPT Realtime 2 · Aug 13: 100.0%GPT Realtime 2 · Aug 14: 86.7%GPT Realtime 2 · Aug 16: 89.7%GPT Realtime 2 · Aug 17: 93.3%GPT Realtime 2 · Aug 18: 88.9%GPT Realtime 2 · Aug 19: 81.5%GPT Realtime 2 · Aug 20: 100.0%GPT Realtime 2 · Aug 21: 0.0%GPT Realtime 2 · Aug 22: 0.0%GPT Realtime 2 · Aug 23: 0.0%GPT Realtime 2 · Aug 24: 0.0%GPT Realtime 2 · Aug 25: 0.0%GPT Realtime 2 · Aug 26: 0.0%GPT Realtime 2 · Aug 27: 0.0%

Limits of this comparison

Coval measures complete multi-turn calls rather than combining separate transcription and synthesis results.

  • The leaderboard is pinned to Coval's clean multi-turn condition and does not represent every voice, tool-use pattern or session configuration.

Official sources

Results are re-measured daily using fixed datasets and reported over a rolling 30-day window. Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo