{ "model_name": "Gemini 3.1 Pro Preview", "model_organization": "Google", "submitting_organization": "Sierra", "submission_date": "2026-05-05", "contact_info": { "email": "ben.s@sierra.ai", "name": "Sierra Research Team" }, "is_new": true, "submission_type": "standard", "trajectories_available": true, "trajectory_files": { "banking_knowledge": "gemini-3.1-pro-preview_high_banking_knowledge_gpt-5.2_4trials.json" }, "references": [], "results": { "airline": null, "retail": null, "telecom": null, "banking_knowledge": { "pass_1": 26.03, "pass_2": 15.12, "pass_3": 11.08, "pass_4": 9.28, "cost": null, "retrieval_config": "alltools" } }, "reasoning_effort": "high", "methodology": { "evaluation_date": "2026-05-05", "tau2_bench_version": "1.0.1", "user_simulator": "gpt-5.2", "notes": "Evaluated using AllTools retrieval (BM25 + dense OpenAI text-embedding-3-large + sandboxed shell). User simulator: gpt-5.2 with reasoning_effort: low. 4 trials. Seed: 300. Banking_knowledge domain only — other domains intentionally excluded from this comparison; the AllTools setting standardizes retrieval across models. banking_knowledge re-graded under tau2-bench v1.0.1 grading fixes on 2026-07-15 (extra-read logging #329, numeric-argument normalization #397, T077-T086 gold trajectories #402); scores prior to v1.0.1 are not comparable.", "verification": { "modified_prompts": false, "omitted_questions": false, "details": "Banking_knowledge domain only, AllTools retrieval. Trajectories suppressed for this preliminary AllTools comparison; raw per-task results retained internally." } }, "model_release": { "release_date": "2026-02-19", "announcement_url": "https://deepmind.google/blog/gemini-3-1-pro-a-smarter-model-for-your-most-complex-tasks/", "announcement_title": "Gemini 3.1 Pro: A smarter model for your most complex tasks" } }