{ "model_name": "Cascaded baseline", "model_organization": "Multiple providers", "submitting_organization": "Sierra", "submission_date": "2026-05-19", "submission_type": "standard", "modality": "voice", "contact_info": { "email": "ben.s@sierra.ai", "name": "Sierra Research Team" }, "results": { "retail": { "pass_1": 28.947368421052634 }, "airline": { "pass_1": 48.0 }, "telecom": { "pass_1": 16.666666666666664 } }, "is_new": true, "trajectories_available": true, "trajectory_files": { "airline": "airline_regular_livekit", "retail": "retail_regular_livekit", "telecom": "telecom_regular_livekit" }, "methodology": { "evaluation_date": "2026-04-20", "tau2_bench_version": "1.0.0", "user_simulator": "v1.0", "notes": "Cascaded STT-LLM-TTS pipeline using Deepgram nova-3 STT, OpenAI gpt-4.1 LLM, and Deepgram aura-asteria-en TTS. Full-duplex audio-native evaluation using regular speech complexity (realistic audio conditions). 1 trial per task.", "verification": { "modified_prompts": false, "omitted_questions": false } }, "voice_config": { "provider": "Cascaded", "model": "STT-LLM-TTS", "pipeline": { "asr": "Deepgram nova-3", "llm": "OpenAI gpt-4.1", "tts": "Deepgram aura-asteria-en" }, "tick_duration_seconds": 0.2, "max_steps_seconds": 1200.0, "user_tts_provider": "elevenlabs/eleven_v3" }, "model_release": { "release_date": "2026-05-19" }, "references": [], "interaction_metrics": { "version": "1.0", "config": { "tick_duration_sec": 0.2, "no_yield_window_sec": 2.0, "backchannel_yield_window_sec": 1.0, "vocal_tic_yield_window_sec": 1.0, "non_directed_yield_window_sec": 1.0, "vocal_tic_response_window_sec": 2.0, "non_directed_response_window_sec": 2.0 }, "domains": { "airline": { "response_latency_mean": 4.4028021015761825, "yield_latency_mean": 0.8839328537170265, "response_rate": 0.7664429530201342, "yield_rate": 0.9858156028368794, "agent_interruption_rate": 0.7087248322147651, "selectivity_backchannel": 0.75, "selectivity_vocal_tic": 0.4631578947368421, "selectivity_non_directed": 0.6111111111111112, "counts": { "n_simulations": 50, "response_total": 745, "yield_total": 423, "backchannel_total": 8, "vocal_tic_total": 95, "non_directed_total": 54, "agent_interrupts_count": 528 } }, "retail": { "response_latency_mean": 4.016493313521546, "yield_latency_mean": 0.843699421965318, "response_rate": 0.768703597944032, "yield_rate": 0.9919724770642202, "agent_interruption_rate": 0.5762421473443746, "selectivity_backchannel": 0.5714285714285714, "selectivity_vocal_tic": 0.4971428571428571, "selectivity_non_directed": 0.5227272727272727, "counts": { "n_simulations": 114, "response_total": 1751, "yield_total": 872, "backchannel_total": 14, "vocal_tic_total": 175, "non_directed_total": 132, "agent_interrupts_count": 1009 } }, "telecom": { "response_latency_mean": 4.291288160833953, "yield_latency_mean": 0.8824863174354965, "response_rate": 0.8369339426672207, "yield_rate": 0.985362095531587, "agent_interruption_rate": 0.6476942251765684, "selectivity_backchannel": 0.6799999999999999, "selectivity_vocal_tic": 0.5067961165048543, "selectivity_non_directed": 0.5981308411214954, "counts": { "n_simulations": 114, "response_total": 4814, "yield_total": 2596, "backchannel_total": 25, "vocal_tic_total": 515, "non_directed_total": 321, "agent_interrupts_count": 3118 } } }, "overall": { "response_latency_mean": 4.236861191977227, "yield_latency_mean": 0.8700395310392803, "response_rate": 0.790693497877129, "yield_rate": 0.9877167251442289, "agent_interruption_rate": 0.6442204015785694, "selectivity_backchannel": 0.6671428571428571, "selectivity_vocal_tic": 0.48903228946151783, "selectivity_non_directed": 0.5773230749866264, "counts": { "agent_interrupts_count": 4655, "backchannel_total": 47, "n_simulations": 278, "non_directed_total": 507, "response_total": 7310, "vocal_tic_total": 785, "yield_total": 3891 } } } }