{ "model_name": "Claude Opus 4.6", "model_organization": "Anthropic", "submitting_organization": "Sierra", "submission_date": "2026-05-05", "contact_info": { "email": "ben.s@sierra.ai", "name": "Sierra Research Team" }, "is_new": true, "submission_type": "standard", "trajectories_available": true, "trajectory_files": { "banking_knowledge": "claude-opus-4-6_max_banking_knowledge_gpt-5.2_4trials.json" }, "references": [], "results": { "airline": null, "retail": null, "telecom": null, "banking_knowledge": { "pass_1": 27.32, "pass_2": 18.73, "pass_3": 14.18, "pass_4": 11.34, "cost": null, "retrieval_config": "alltools" } }, "reasoning_effort": "max", "methodology": { "evaluation_date": "2026-05-06", "tau2_bench_version": "1.0.1", "user_simulator": "gpt-5.2", "notes": "Evaluated with reasoning_effort 'max' (the highest effort level this model supports). Retrieval: AllTools (BM25 + dense OpenAI text-embedding-3-large + sandboxed shell). User simulator: gpt-5.2 with reasoning_effort: low. 4 trials. Seed: 300. Banking_knowledge domain only — other domains intentionally excluded from this comparison; the AllTools setting standardizes retrieval across models. banking_knowledge re-graded under tau2-bench v1.0.1 grading fixes on 2026-07-15 (extra-read logging #329, numeric-argument normalization #397, T077-T086 gold trajectories #402); scores prior to v1.0.1 are not comparable.", "verification": { "modified_prompts": false, "omitted_questions": false, "details": "Banking_knowledge domain only, AllTools retrieval. Trajectories suppressed for this preliminary AllTools comparison; raw per-task results retained internally." } }, "model_release": { "release_date": "2026-02-05", "announcement_url": null } }