{ "model_name": "gemini-3.1-flash-live-preview-thinking-minimal", "model_organization": "Google", "submitting_organization": "Sierra", "submission_date": "2026-04-13", "submission_type": "standard", "modality": "voice", "contact_info": { "email": "keshav@sierra.ai", "name": "Sierra Research Team" }, "results": { "retail": { "pass_1": 26.31578947368421 }, "airline": { "pass_1": 42.0 }, "telecom": { "pass_1": 17.543859649122805 } }, "is_new": true, "trajectories_available": true, "trajectory_files": { "airline": "airline_regular_gemini_gemini-3.1-flash-live-preview", "retail": "retail_regular_gemini_gemini-3.1-flash-live-preview", "telecom": "telecom_regular_gemini_gemini-3.1-flash-live-preview" }, "reasoning_effort": "minimal", "methodology": { "evaluation_date": "2026-04-13", "tau2_bench_version": "1.0.0", "user_simulator": "v1.0", "notes": "Evaluated using Gemini 3.1 Flash Live Preview with thinking = MINIMAL.", "verification": { "modified_prompts": false, "omitted_questions": false } }, "voice_config": { "provider": "Google", "model": "gemini-3.1-flash-live-preview-thinking-minimal", "tick_duration_seconds": 0.2, "max_steps_seconds": 600.0, "user_tts_provider": "elevenlabs/eleven_v3" }, "model_release": { "release_date": "2026-03-26", "announcement_url": "https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-flash-live/", "announcement_title": "Gemini 3.1 Flash Live: Google's latest AI audio model" }, "interaction_metrics": { "version": "1.0", "config": { "tick_duration_sec": 0.2, "no_yield_window_sec": 2.0, "backchannel_yield_window_sec": 1.0, "vocal_tic_yield_window_sec": 1.0, "non_directed_yield_window_sec": 1.0, "vocal_tic_response_window_sec": 2.0, "non_directed_response_window_sec": 2.0 }, "domains": { "airline": { "response_latency_mean": 1.5637096774193529, "yield_latency_mean": 0.8020905923344949, "response_rate": 0.9725490196078431, "yield_rate": 0.5942028985507246, "agent_interruption_rate": 0.09411764705882353, "selectivity_backchannel": 0.8947368421052632, "selectivity_vocal_tic": 0.6346153846153846, "selectivity_non_directed": 0.3055555555555556, "counts": { "n_simulations": 50, "response_total": 510, "yield_total": 483, "backchannel_total": 19, "vocal_tic_total": 52, "non_directed_total": 36, "agent_interrupts_count": 48 } }, "retail": { "response_latency_mean": 1.835789473684209, "yield_latency_mean": 0.8098214285714286, "response_rate": 0.9557344064386318, "yield_rate": 0.4843243243243243, "agent_interruption_rate": 0.09557344064386318, "selectivity_backchannel": 0.8367346938775511, "selectivity_vocal_tic": 0.5333333333333333, "selectivity_non_directed": 0.2588235294117647, "counts": { "n_simulations": 114, "response_total": 994, "yield_total": 925, "backchannel_total": 49, "vocal_tic_total": 120, "non_directed_total": 85, "agent_interrupts_count": 95 } }, "telecom": { "response_latency_mean": 1.518483412322274, "yield_latency_mean": 0.8547215496368039, "response_rate": 0.9806351665375678, "yield_rate": 0.4887573964497041, "agent_interruption_rate": 0.10534469403563129, "selectivity_backchannel": 0.96, "selectivity_vocal_tic": 0.37142857142857144, "selectivity_non_directed": 0.24444444444444446, "counts": { "n_simulations": 114, "response_total": 1291, "yield_total": 845, "backchannel_total": 25, "vocal_tic_total": 140, "non_directed_total": 90, "agent_interrupts_count": 136 } } }, "overall": { "response_latency_mean": 1.6393275211419454, "yield_latency_mean": 0.8222111901809092, "response_rate": 0.9696395308613476, "yield_rate": 0.5224282064415844, "agent_interruption_rate": 0.09834526057943933, "selectivity_backchannel": 0.897157178660938, "selectivity_vocal_tic": 0.5131257631257631, "selectivity_non_directed": 0.2696078431372549, "counts": { "agent_interrupts_count": 279, "backchannel_total": 93, "n_simulations": 278, "non_directed_total": 211, "response_total": 2795, "vocal_tic_total": 312, "yield_total": 2253 } } } }