{ "model_name": "gpt-realtime-1.5", "model_organization": "OpenAI", "submitting_organization": "Sierra", "submission_date": "2026-03-03", "submission_type": "standard", "modality": "voice", "contact_info": { "email": "victor@sierra.ai", "name": "Sierra Research Team" }, "is_new": true, "trajectories_available": true, "trajectory_files": { "airline": "airline_regular_openai_gpt-realtime-1.5", "retail": "retail_regular_openai_gpt-realtime-1.5", "telecom": "telecom_regular_openai_gpt-realtime-1.5" }, "results": { "airline": { "pass_1": 40.0 }, "retail": { "pass_1": 44.7 }, "telecom": { "pass_1": 21.1 } }, "voice_config": { "provider": "OpenAI", "model": "gpt-realtime-1.5", "tick_duration_seconds": 0.2, "max_steps_seconds": 600, "user_tts_provider": "elevenlabs/eleven_v3" }, "methodology": { "evaluation_date": "2026-03-03", "tau2_bench_version": "1.0.0", "user_simulator": "v1.0", "notes": "Full-duplex audio-native evaluation using regular speech complexity (realistic audio conditions). 1 trial per task.", "verification": { "modified_prompts": false, "omitted_questions": false } }, "model_release": { "release_date": "2026-02-23", "announcement_url": "https://developers.openai.com/api/docs/models/gpt-realtime-1.5", "announcement_title": "gpt-realtime-1.5 Model | OpenAI API" }, "interaction_metrics": { "version": "1.0", "config": { "tick_duration_sec": 0.2, "no_yield_window_sec": 2.0, "backchannel_yield_window_sec": 1.0, "vocal_tic_yield_window_sec": 1.0, "non_directed_yield_window_sec": 1.0, "vocal_tic_response_window_sec": 2.0, "non_directed_response_window_sec": 2.0 }, "domains": { "airline": { "response_latency_mean": 1.4279069767441859, "yield_latency_mean": 0.417479674796748, "response_rate": 0.9985486211901307, "yield_rate": 1.0, "agent_interruption_rate": 0.14223512336719885, "selectivity_backchannel": 0.023255813953488413, "selectivity_vocal_tic": 0.06493506493506496, "selectivity_non_directed": 0.0714285714285714, "counts": { "n_simulations": 50, "response_total": 689, "yield_total": 492, "backchannel_total": 43, "vocal_tic_total": 77, "non_directed_total": 98, "agent_interrupts_count": 98 } }, "retail": { "response_latency_mean": 1.3924137931034484, "yield_latency_mean": 0.4255744255744257, "response_rate": 0.9993108201240524, "yield_rate": 1.0, "agent_interruption_rate": 0.14679531357684356, "selectivity_backchannel": 0.033333333333333326, "selectivity_vocal_tic": 0.06153846153846154, "selectivity_non_directed": 0.08433734939759041, "counts": { "n_simulations": 114, "response_total": 1451, "yield_total": 1001, "backchannel_total": 90, "vocal_tic_total": 130, "non_directed_total": 166, "agent_interrupts_count": 213 } }, "telecom": { "response_latency_mean": 1.346034276604224, "yield_latency_mean": 0.4145584725536993, "response_rate": 1.0, "yield_rate": 0.99880810488677, "agent_interruption_rate": 0.11717815862893582, "selectivity_backchannel": 0.0, "selectivity_vocal_tic": 0.03200000000000003, "selectivity_non_directed": 0.13461538461538458, "counts": { "n_simulations": 114, "response_total": 2509, "yield_total": 1678, "backchannel_total": 32, "vocal_tic_total": 250, "non_directed_total": 208, "agent_interrupts_count": 294 } } }, "overall": { "response_latency_mean": 1.388785015483953, "yield_latency_mean": 0.4192041909749577, "response_rate": 0.999286480438061, "yield_rate": 0.9996027016289233, "agent_interruption_rate": 0.13540286519099273, "selectivity_backchannel": 0.018863049095607248, "selectivity_vocal_tic": 0.05282450882450884, "selectivity_non_directed": 0.09679376848051546, "counts": { "agent_interrupts_count": 605, "backchannel_total": 165, "n_simulations": 278, "non_directed_total": 472, "response_total": 4649, "vocal_tic_total": 457, "yield_total": 3171 } } } }