{ "model_name": "Grok 4.2", "model_organization": "xAI", "submitting_organization": "Sierra", "submission_date": "2026-05-05", "contact_info": { "email": "ben.s@sierra.ai", "name": "Sierra Research Team" }, "is_new": true, "submission_type": "standard", "trajectories_available": true, "trajectory_files": { "banking_knowledge": "grok-4-2_high_banking_knowledge_gpt-5.2_4trials.json" }, "references": [], "results": { "airline": null, "retail": null, "telecom": null, "banking_knowledge": { "pass_1": 18.04, "pass_2": 12.37, "pass_3": 10.05, "pass_4": 8.25, "cost": null, "retrieval_config": "alltools" } }, "reasoning_effort": "high", "methodology": { "evaluation_date": "2026-05-05", "tau2_bench_version": "1.0.1", "user_simulator": "gpt-5.2", "notes": "Evaluated using AllTools retrieval (BM25 + dense OpenAI text-embedding-3-large + sandboxed shell). User simulator: gpt-5.2 with reasoning_effort: low. 4 trials. Seed: 300. Banking_knowledge domain only — other domains intentionally excluded from this comparison; the AllTools setting standardizes retrieval across models. xAI's `-reasoning` model variant (always-on chain-of-thought); launched with `temperature: 0.0` since reasoning is gated by model name on this provider, not by an `effort` parameter. banking_knowledge re-graded under tau2-bench v1.0.1 grading fixes on 2026-07-15 (extra-read logging #329, numeric-argument normalization #397, T077-T086 gold trajectories #402); scores prior to v1.0.1 are not comparable.", "verification": { "modified_prompts": false, "omitted_questions": false, "details": "Banking_knowledge domain only, AllTools retrieval. Trajectories suppressed for this preliminary AllTools comparison; raw per-task results retained internally." } }, "model_release": { "release_date": "2026-03-10", "announcement_url": "https://docs.x.ai/docs/release-notes", "announcement_title": "Grok 4.20-0309 (Reasoning)" } }