{ "model_name": "gpt-realtime-2", "model_organization": "OpenAI", "submitting_organization": "Sierra", "submission_date": "2026-07-01", "submission_type": "standard", "modality": "voice", "contact_info": { "email": "soham@sierra.ai", "name": "Sierra Research Team" }, "results": { "retail": { "pass_1": 39.473684210526315 }, "airline": { "pass_1": 56.00000000000001 }, "telecom": { "pass_1": 20.175438596491226 } }, "is_new": true, "trajectories_available": true, "trajectory_files": { "airline": "gpt-realtime-2_voice_minimal_airline", "retail": "gpt-realtime-2_voice_minimal_retail", "telecom": "gpt-realtime-2_voice_minimal_telecom" }, "methodology": { "evaluation_date": "2026-07-01", "tau2_bench_version": "1.0.0", "user_simulator": "v1.0", "verification": { "modified_prompts": false, "omitted_questions": false } }, "voice_config": { "provider": "openai", "model": "gpt-realtime-2", "tick_duration_seconds": 0.2, "max_steps_seconds": 1200.0, "user_tts_provider": "elevenlabs/eleven_v3" }, "model_release": { "release_date": "2026-05-07", "announcement_url": "https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/", "announcement_title": "Advancing voice intelligence with new models in the API" }, "reasoning_effort": "minimal", "interaction_metrics": { "version": "1.0", "config": { "tick_duration_sec": 0.2, "no_yield_window_sec": 2.0, "backchannel_yield_window_sec": 1.0, "vocal_tic_yield_window_sec": 1.0, "non_directed_yield_window_sec": 1.0, "vocal_tic_response_window_sec": 2.0, "non_directed_response_window_sec": 2.0 }, "domains": { "airline": { "response_latency_mean": 1.4709219858156015, "yield_latency_mean": 0.618627450980392, "response_rate": 0.9964664310954063, "yield_rate": 1.0, "agent_interruption_rate": 0.18374558303886926, "selectivity_backchannel": 0.0, "selectivity_vocal_tic": 0.05555555555555558, "selectivity_non_directed": 0.16279069767441856, "counts": { "n_simulations": 50, "response_total": 283, "yield_total": 204, "backchannel_total": 28, "vocal_tic_total": 36, "non_directed_total": 43, "agent_interrupts_count": 52 } }, "retail": { "response_latency_mean": 1.443644544431945, "yield_latency_mean": 0.6187279151943462, "response_rate": 0.9977553310886644, "yield_rate": 1.0, "agent_interruption_rate": 0.20089786756453423, "selectivity_backchannel": 0.038961038961038974, "selectivity_vocal_tic": 0.06024096385542166, "selectivity_non_directed": 0.14925373134328357, "counts": { "n_simulations": 114, "response_total": 891, "yield_total": 566, "backchannel_total": 77, "vocal_tic_total": 83, "non_directed_total": 134, "agent_interrupts_count": 179 } }, "telecom": { "response_latency_mean": 1.4040816326530599, "yield_latency_mean": 0.6238095238095239, "response_rate": 1.0, "yield_rate": 0.9966101694915255, "agent_interruption_rate": 0.17573696145124718, "selectivity_backchannel": 0.01851851851851849, "selectivity_vocal_tic": 0.07317073170731703, "selectivity_non_directed": 0.19148936170212771, "counts": { "n_simulations": 114, "response_total": 882, "yield_total": 590, "backchannel_total": 54, "vocal_tic_total": 82, "non_directed_total": 94, "agent_interrupts_count": 155 } } }, "overall": { "response_latency_mean": 1.4395493876335355, "yield_latency_mean": 0.6203882966614207, "response_rate": 0.9980739207280237, "yield_rate": 0.9988700564971751, "agent_interruption_rate": 0.18679347068488358, "selectivity_backchannel": 0.01915985249318582, "selectivity_vocal_tic": 0.06298908370609808, "selectivity_non_directed": 0.16784459690660994, "counts": { "agent_interrupts_count": 386, "backchannel_total": 159, "n_simulations": 278, "non_directed_total": 271, "response_total": 2056, "vocal_tic_total": 201, "yield_total": 1360 } } } }