{ "model_name": "gpt-realtime-1.0", "model_organization": "OpenAI", "submitting_organization": "Sierra", "submission_date": "2026-04-13", "submission_type": "standard", "modality": "voice", "contact_info": { "email": "victor@sierra.ai", "name": "Sierra Research Team" }, "results": { "retail": { "pass_1": 35.96491228070175 }, "airline": { "pass_1": 36.0 }, "telecom": { "pass_1": 19.298245614035086 } }, "is_new": true, "trajectories_available": true, "trajectory_files": { "airline": "airline_regular_openai_gpt-realtime-2025-08-28", "retail": "retail_regular_openai_gpt-realtime-2025-08-28", "telecom": "telecom_regular_openai_gpt-realtime-2025-08-28" }, "methodology": { "evaluation_date": "2026-03-27", "tau2_bench_version": "1.0.0", "user_simulator": "v1.0", "verification": { "modified_prompts": false, "omitted_questions": false } }, "voice_config": { "provider": "OpenAI", "model": "gpt-realtime-1.0", "tick_duration_seconds": 0.2, "max_steps_seconds": 600.0, "user_tts_provider": "elevenlabs/eleven_v3" }, "model_release": { "release_date": "2025-08-28", "announcement_url": "https://openai.com/index/introducing-gpt-realtime/", "announcement_title": "Introducing gpt-realtime" }, "interaction_metrics": { "version": "1.0", "config": { "tick_duration_sec": 0.2, "no_yield_window_sec": 2.0, "backchannel_yield_window_sec": 1.0, "vocal_tic_yield_window_sec": 1.0, "non_directed_yield_window_sec": 1.0, "vocal_tic_response_window_sec": 2.0, "non_directed_response_window_sec": 2.0 }, "domains": { "airline": { "response_latency_mean": 1.5197183098591538, "yield_latency_mean": 0.42000000000000004, "response_rate": 0.9681818181818181, "yield_rate": 0.9926470588235294, "agent_interruption_rate": 0.12045454545454545, "selectivity_backchannel": 0.09375, "selectivity_vocal_tic": 0.04878048780487809, "selectivity_non_directed": 0.10256410256410253, "counts": { "n_simulations": 50, "response_total": 440, "yield_total": 272, "backchannel_total": 32, "vocal_tic_total": 41, "non_directed_total": 39, "agent_interrupts_count": 53 } }, "retail": { "response_latency_mean": 1.607185628742514, "yield_latency_mean": 0.4097693351424695, "response_rate": 0.984006734006734, "yield_rate": 1.0, "agent_interruption_rate": 0.132996632996633, "selectivity_backchannel": 0.015625, "selectivity_vocal_tic": 0.0535714285714286, "selectivity_non_directed": 0.14876033057851235, "counts": { "n_simulations": 114, "response_total": 1188, "yield_total": 737, "backchannel_total": 64, "vocal_tic_total": 112, "non_directed_total": 121, "agent_interrupts_count": 158 } }, "telecom": { "response_latency_mean": 1.472087658592848, "yield_latency_mean": 0.4134597156398105, "response_rate": 0.9824362606232294, "yield_rate": 1.0, "agent_interruption_rate": 0.11558073654390935, "selectivity_backchannel": 0.023809523809523836, "selectivity_vocal_tic": 0.05434782608695654, "selectivity_non_directed": 0.13812154696132595, "counts": { "n_simulations": 114, "response_total": 1765, "yield_total": 1055, "backchannel_total": 42, "vocal_tic_total": 184, "non_directed_total": 181, "agent_interrupts_count": 204 } } }, "overall": { "response_latency_mean": 1.5329971990648386, "yield_latency_mean": 0.41440968359409336, "response_rate": 0.9782082709372606, "yield_rate": 0.9975490196078431, "agent_interruption_rate": 0.12301063833169594, "selectivity_backchannel": 0.04439484126984128, "selectivity_vocal_tic": 0.05223324748775441, "selectivity_non_directed": 0.1298153267013136, "counts": { "agent_interrupts_count": 415, "backchannel_total": 138, "n_simulations": 278, "non_directed_total": 341, "response_total": 3393, "vocal_tic_total": 337, "yield_total": 2064 } } } }