{ "model_name": "gpt-realtime-2", "model_organization": "OpenAI", "submitting_organization": "Sierra", "submission_date": "2026-06-29", "submission_type": "standard", "modality": "voice", "contact_info": { "email": "soham@sierra.ai", "name": "Sierra Research Team" }, "results": { "retail": { "pass_1": 47.368421052631575 }, "airline": { "pass_1": 57.99999999999999 }, "telecom": { "pass_1": 21.929824561403507 } }, "is_new": true, "trajectories_available": true, "trajectory_files": { "airline": "gpt-realtime-2_voice_xhigh_airline", "retail": "gpt-realtime-2_voice_xhigh_retail", "telecom": "gpt-realtime-2_voice_xhigh_telecom" }, "methodology": { "evaluation_date": "2026-06-24", "tau2_bench_version": "1.0.0", "user_simulator": "v1.0", "verification": { "modified_prompts": false, "omitted_questions": false } }, "voice_config": { "provider": "openai", "model": "gpt-realtime-2", "tick_duration_seconds": 0.2, "max_steps_seconds": 1200.0, "user_tts_provider": "elevenlabs/eleven_v3" }, "model_release": { "release_date": "2026-05-07", "announcement_url": "https://openai.com/index/advancing-voice-intelligence-with-new-models-in-the-api/", "announcement_title": "Advancing voice intelligence with new models in the API" }, "reasoning_effort": "xhigh", "interaction_metrics": { "version": "1.0", "config": { "tick_duration_sec": 0.2, "no_yield_window_sec": 2.0, "backchannel_yield_window_sec": 1.0, "vocal_tic_yield_window_sec": 1.0, "non_directed_yield_window_sec": 1.0, "vocal_tic_response_window_sec": 2.0, "non_directed_response_window_sec": 2.0 }, "domains": { "airline": { "response_latency_mean": 2.0741573033707863, "yield_latency_mean": 0.6270742358078601, "response_rate": 0.9081632653061225, "yield_rate": 1.0, "agent_interruption_rate": 0.2066326530612245, "selectivity_backchannel": 0.05555555555555558, "selectivity_vocal_tic": 0.21052631578947367, "selectivity_non_directed": 0.16666666666666663, "counts": { "n_simulations": 50, "response_total": 392, "yield_total": 229, "backchannel_total": 18, "vocal_tic_total": 38, "non_directed_total": 24, "agent_interrupts_count": 81 } }, "retail": { "response_latency_mean": 1.946205357142856, "yield_latency_mean": 0.613448275862069, "response_rate": 0.9718004338394793, "yield_rate": 0.9931506849315068, "agent_interruption_rate": 0.23535791757049893, "selectivity_backchannel": 0.04347826086956519, "selectivity_vocal_tic": 0.125, "selectivity_non_directed": 0.16346153846153844, "counts": { "n_simulations": 114, "response_total": 922, "yield_total": 584, "backchannel_total": 69, "vocal_tic_total": 88, "non_directed_total": 104, "agent_interrupts_count": 217 } }, "telecom": { "response_latency_mean": 1.9145945945945937, "yield_latency_mean": 0.6064264849074974, "response_rate": 0.9730440499671269, "yield_rate": 0.9990272373540856, "agent_interruption_rate": 0.18080210387902695, "selectivity_backchannel": 0.017857142857142905, "selectivity_vocal_tic": 0.048387096774193505, "selectivity_non_directed": 0.13725490196078427, "counts": { "n_simulations": 114, "response_total": 1521, "yield_total": 1028, "backchannel_total": 56, "vocal_tic_total": 124, "non_directed_total": 153, "agent_interrupts_count": 275 } } }, "overall": { "response_latency_mean": 1.9783190850360786, "yield_latency_mean": 0.6156496655258089, "response_rate": 0.9510025830375762, "yield_rate": 0.9973926407618642, "agent_interruption_rate": 0.20759755817025013, "selectivity_backchannel": 0.03896365309408789, "selectivity_vocal_tic": 0.12797113752122238, "selectivity_non_directed": 0.15579436902966312, "counts": { "agent_interrupts_count": 573, "backchannel_total": 143, "n_simulations": 278, "non_directed_total": 281, "response_total": 2835, "vocal_tic_total": 250, "yield_total": 1841 } } } }