{ "model_name": "gemini-live-2.5-flash-native-audio", "model_organization": "Google", "submitting_organization": "Sierra", "submission_date": "2026-03-03", "submission_type": "standard", "modality": "voice", "contact_info": { "email": "victor@sierra.ai", "name": "Sierra Research Team" }, "is_new": true, "trajectories_available": true, "trajectory_files": { "airline": "airline_regular_gemini_gemini-live-2.5-flash-native-audio", "retail": "retail_regular_gemini_gemini-live-2.5-flash-native-audio", "telecom": "telecom_regular_gemini_gemini-live-2.5-flash-native-audio" }, "results": { "airline": { "pass_1": 30.0 }, "retail": { "pass_1": 29.8 }, "telecom": { "pass_1": 17.5 } }, "voice_config": { "provider": "Google", "model": "gemini-live-2.5-flash-native-audio", "tick_duration_seconds": 0.2, "max_steps_seconds": 600, "user_tts_provider": "elevenlabs/eleven_v3" }, "methodology": { "evaluation_date": "2026-03-03", "tau2_bench_version": "1.0.0", "user_simulator": "v1.0", "notes": "Full-duplex audio-native evaluation using regular speech complexity (realistic audio conditions). 1 trial per task.", "verification": { "modified_prompts": false, "omitted_questions": false } }, "model_release": { "release_date": "2025-12-12", "announcement_url": "https://cloud.google.com/blog/products/ai-machine-learning/gemini-live-api-available-on-vertex-ai", "announcement_title": "Gemini Live API on Vertex AI" }, "interaction_metrics": { "version": "1.0", "config": { "tick_duration_sec": 0.2, "no_yield_window_sec": 2.0, "backchannel_yield_window_sec": 1.0, "vocal_tic_yield_window_sec": 1.0, "non_directed_yield_window_sec": 1.0, "vocal_tic_response_window_sec": 2.0, "non_directed_response_window_sec": 2.0 }, "domains": { "airline": { "response_latency_mean": 1.4598382749326142, "yield_latency_mean": 0.7253333333333333, "response_rate": 0.8047722342733189, "yield_rate": 0.5725190839694656, "agent_interruption_rate": 0.19088937093275488, "selectivity_backchannel": 0.8888888888888888, "selectivity_vocal_tic": 0.4, "selectivity_non_directed": 0.5483870967741935, "counts": { "n_simulations": 50, "response_total": 461, "yield_total": 131, "backchannel_total": 9, "vocal_tic_total": 35, "non_directed_total": 31, "agent_interrupts_count": 88 } }, "retail": { "response_latency_mean": 1.4463519313304718, "yield_latency_mean": 0.8627218934911244, "response_rate": 0.7945439045183291, "yield_rate": 0.6145454545454545, "agent_interruption_rate": 0.16624040920716113, "selectivity_backchannel": 0.9090909090909091, "selectivity_vocal_tic": 0.2844036697247706, "selectivity_non_directed": 0.4464285714285714, "counts": { "n_simulations": 114, "response_total": 1173, "yield_total": 275, "backchannel_total": 33, "vocal_tic_total": 109, "non_directed_total": 56, "agent_interrupts_count": 195 } }, "telecom": { "response_latency_mean": 1.3810391978122138, "yield_latency_mean": 0.9896103896103896, "response_rate": 0.8192681105302465, "yield_rate": 0.5049180327868853, "agent_interruption_rate": 0.2621359223300971, "selectivity_backchannel": 0.75, "selectivity_vocal_tic": 0.33333333333333337, "selectivity_non_directed": 0.34285714285714286, "counts": { "n_simulations": 114, "response_total": 1339, "yield_total": 305, "backchannel_total": 4, "vocal_tic_total": 105, "non_directed_total": 70, "agent_interrupts_count": 351 } } }, "overall": { "response_latency_mean": 1.4290764680250998, "yield_latency_mean": 0.859221872144949, "response_rate": 0.8061947497739649, "yield_rate": 0.5639941904339351, "agent_interruption_rate": 0.2064219008233377, "selectivity_backchannel": 0.8493265993265994, "selectivity_vocal_tic": 0.33924566768603465, "selectivity_non_directed": 0.44589093701996924, "counts": { "agent_interrupts_count": 634, "backchannel_total": 46, "n_simulations": 278, "non_directed_total": 157, "response_total": 2973, "vocal_tic_total": 249, "yield_total": 711 } } } }