{ "model_name": "grok-voice-think-fast-2.0", "model_organization": "xAI", "submitting_organization": "Sierra", "submission_date": "2026-08-06", "submission_type": "standard", "modality": "voice", "contact_info": { "email": "keshav@sierra.ai", "name": "Sierra Research Team" }, "results": { "retail": { "pass_1": 59.64912280701754, "cost": 0.23825263157894733 }, "airline": { "pass_1": 56.00000000000001, "cost": 0.20933333333333337 }, "telecom": { "pass_1": 71.9298245614035, "cost": 0.38721871345029246 } }, "is_new": true, "trajectories_available": true, "trajectory_files": { "airline": "airline_regular_xai", "retail": "retail_regular_xai", "telecom": "telecom_regular_xai" }, "methodology": { "evaluation_date": "2026-08-06", "tau2_bench_version": "1.0.1", "user_simulator": "v1.0", "notes": "Full-duplex audio-native evaluation using regular speech complexity (realistic audio conditions). 1 trial per task.", "verification": { "modified_prompts": false, "omitted_questions": false } }, "voice_config": { "provider": "xai", "model": "grok-voice-think-fast-2.0", "tick_duration_seconds": 0.2, "max_steps_seconds": 1200.0, "user_tts_provider": "elevenlabs/eleven_v3" }, "interaction_metrics": { "version": "1.0", "config": { "tick_duration_sec": 0.2, "no_yield_window_sec": 2.0, "backchannel_yield_window_sec": 1.0, "vocal_tic_yield_window_sec": 1.0, "non_directed_yield_window_sec": 1.0, "vocal_tic_response_window_sec": 2.0, "non_directed_response_window_sec": 2.0 }, "domains": { "airline": { "response_latency_mean": 1.6867924528301874, "yield_latency_mean": 0.9123076923076923, "response_rate": 1.0, "yield_rate": 0.959409594095941, "agent_interruption_rate": 0.13746630727762804, "selectivity_backchannel": 0.5483870967741935, "selectivity_vocal_tic": 0.33333333333333337, "selectivity_non_directed": 0.2682926829268293, "counts": { "n_simulations": 50, "response_total": 371, "yield_total": 271, "backchannel_total": 31, "vocal_tic_total": 30, "non_directed_total": 41, "agent_interrupts_count": 51 } }, "retail": { "response_latency_mean": 1.778121546961324, "yield_latency_mean": 0.9117088607594938, "response_rate": 1.0, "yield_rate": 0.9678407350689127, "agent_interruption_rate": 0.11602209944751381, "selectivity_backchannel": 0.5217391304347826, "selectivity_vocal_tic": 0.36986301369863017, "selectivity_non_directed": 0.28, "counts": { "n_simulations": 114, "response_total": 905, "yield_total": 653, "backchannel_total": 92, "vocal_tic_total": 73, "non_directed_total": 75, "agent_interrupts_count": 105 } }, "telecom": { "response_latency_mean": 1.6603235014272104, "yield_latency_mean": 0.9883244882486734, "response_rate": 0.9990494296577946, "yield_rate": 0.9821295606850335, "agent_interruption_rate": 0.06701520912547529, "selectivity_backchannel": 0.34523809523809523, "selectivity_vocal_tic": 0.28402366863905326, "selectivity_non_directed": 0.28301886792452835, "counts": { "n_simulations": 114, "response_total": 2104, "yield_total": 1343, "backchannel_total": 84, "vocal_tic_total": 169, "non_directed_total": 106, "agent_interrupts_count": 141 } } }, "overall": { "response_latency_mean": 1.7084125004062407, "yield_latency_mean": 0.937447013771953, "response_rate": 0.9996831432192649, "yield_rate": 0.969793296616629, "agent_interruption_rate": 0.10683453861687238, "selectivity_backchannel": 0.4717881074823571, "selectivity_vocal_tic": 0.3290733385570056, "selectivity_non_directed": 0.27710385028378587, "counts": { "n_simulations": 278, "response_total": 3380, "yield_total": 2267, "backchannel_total": 207, "vocal_tic_total": 272, "non_directed_total": 222, "agent_interrupts_count": 297 } } }, "model_release": { "release_date": "2026-07-29", "announcement_url": "https://x.ai/news/grok-voice-think-fast-2", "announcement_title": "Introducing Grok Voice Think Fast 2.0" }, "reasoning_effort": "high" }