BENCHMARKS2S2 MODELS RANKEDLAST 30 DAYS

Instruction Adherence (Instruction)

Instruction adherence scores how closely a speech-to-speech model follows the instructions it was given over a multi-turn call, as a percentage. Higher is better.

How it is calculated

Instruction adherence = satisfied evaluated requirements ÷ total evaluated requirements × 100.

How to read it

Unit
%
Better
Higher
Period
Rolling 30 days
Cadence
Re-measured daily

Speech-to-Speech models on Instruction Adherence

Full S2S dashboard
Instruction Adherence — every measured S2S modelPercent · higher is better · 30-day averageEvery S2S model ranked on Instruction Adherence.
median of all models · 73%
S2S models over the last 30 days, ranked on Instruction Adherence.
#ModelHostV2VInstructionSamples
1Gemini 3.1 Flash Live (Preview)Google1380 ms76%753
2GPT Realtime 2OpenAI1306 ms71%801
Under-sampled models are excluded; tied models share a place.

Last 30 days

Daily average for the current top 2 · gaps are days without qualifying runs.

Instruction Adherence — current leadersDaily average per model · UTC daysDaily Instruction Adherence for the current top S2S models over the last 30 days.
Gemini 3.1 Flash Live (Preview) · Jul 31: 93.1%Gemini 3.1 Flash Live (Preview) · Aug 1: 96.7%Gemini 3.1 Flash Live (Preview) · Aug 2: 100.0%Gemini 3.1 Flash Live (Preview) · Aug 3: 96.7%Gemini 3.1 Flash Live (Preview) · Aug 4: 100.0%Gemini 3.1 Flash Live (Preview) · Aug 5: 96.7%Gemini 3.1 Flash Live (Preview) · Aug 6: 100.0%Gemini 3.1 Flash Live (Preview) · Aug 7: 93.3%Gemini 3.1 Flash Live (Preview) · Aug 8: 100.0%Gemini 3.1 Flash Live (Preview) · Aug 9: 93.3%Gemini 3.1 Flash Live (Preview) · Aug 10: 100.0%Gemini 3.1 Flash Live (Preview) · Aug 11: 92.9%Gemini 3.1 Flash Live (Preview) · Aug 12: 96.6%Gemini 3.1 Flash Live (Preview) · Aug 13: 96.4%Gemini 3.1 Flash Live (Preview) · Aug 14: 100.0%Gemini 3.1 Flash Live (Preview) · Aug 16: 86.2%Gemini 3.1 Flash Live (Preview) · Aug 17: 100.0%Gemini 3.1 Flash Live (Preview) · Aug 18: 92.3%Gemini 3.1 Flash Live (Preview) · Aug 19: 88.9%Gemini 3.1 Flash Live (Preview) · Aug 20: 100.0%Gemini 3.1 Flash Live (Preview) · Aug 21: 0.0%Gemini 3.1 Flash Live (Preview) · Aug 22: 0.0%Gemini 3.1 Flash Live (Preview) · Aug 23: 0.0%Gemini 3.1 Flash Live (Preview) · Aug 24: 0.0%Gemini 3.1 Flash Live (Preview) · Aug 25: 0.0%Gemini 3.1 Flash Live (Preview) · Aug 26: 0.0%Gemini 3.1 Flash Live (Preview) · Aug 27: 0.0%GPT Realtime 2 · Jul 31: 93.3%GPT Realtime 2 · Aug 1: 93.3%GPT Realtime 2 · Aug 2: 100.0%GPT Realtime 2 · Aug 3: 96.7%GPT Realtime 2 · Aug 4: 96.6%GPT Realtime 2 · Aug 5: 92.9%GPT Realtime 2 · Aug 6: 83.3%GPT Realtime 2 · Aug 7: 93.3%GPT Realtime 2 · Aug 8: 83.3%GPT Realtime 2 · Aug 9: 90.0%GPT Realtime 2 · Aug 10: 100.0%GPT Realtime 2 · Aug 11: 92.9%GPT Realtime 2 · Aug 12: 80.0%GPT Realtime 2 · Aug 13: 100.0%GPT Realtime 2 · Aug 14: 86.7%GPT Realtime 2 · Aug 16: 89.7%GPT Realtime 2 · Aug 17: 93.3%GPT Realtime 2 · Aug 18: 88.9%GPT Realtime 2 · Aug 19: 81.5%GPT Realtime 2 · Aug 20: 100.0%GPT Realtime 2 · Aug 21: 0.0%GPT Realtime 2 · Aug 22: 0.0%GPT Realtime 2 · Aug 23: 0.0%GPT Realtime 2 · Aug 24: 0.0%GPT Realtime 2 · Aug 25: 0.0%GPT Realtime 2 · Aug 26: 0.0%GPT Realtime 2 · Aug 27: 0.0%
Gemini 3.1 Flash Live (Preview)GPT Realtime 2

About Instruction

Why it matters

Response latency does not show whether a model completed the required task or followed the assigned constraints. Instruction adherence measures those behaviors separately.

Speech-to-speech models receive session instructions directly. The benchmark evaluates whether they continue following those instructions across a multi-turn spoken conversation.

How Coval measures it

Every model runs the same multi-turn simulated calls with the same instructions, daily. Each call is scored for adherence, and the number is reported alongside voice-to-voice latency from the same calls.

Caveats and interpretation

  • The score is bounded by the published scenarios and instructions; it does not establish general reasoning quality or safety.
  • A percentage summarizes evaluated requirements and should be read with the methodology rather than as a human preference score.

The datasets behind it

Every model runs the same fixed inputs, so a gap in Instruction is the model's doing — not the test's.

Same datasets, prompts and metric definitions for every model, measured by Coval’s open-source runner. Full methodology on the overview.

Evaluate your own voice agent

Use Coval to test your production configuration, prompts and calls—not only the public benchmark endpoints.

Book a Demo