{ "model_name": "Claude-3.7-Sonnet", "model_organization": "Anthropic", "submitting_organization": "Sierra", "submission_date": "2025-06-09", "contact_info": { "email": "victor@sierra.ai, ben.s@sierra.ai", "name": "Sierra Research Team" }, "is_new": false, "trajectories_available": false, "references": [ { "title": "τ²-Bench: Evaluating Conversational Agents in a Dual-Control Environment", "url": "https://arxiv.org/abs/2506.07982", "type": "paper" } ], "results": { "retail": { "pass_1": 72.1, "pass_2": 66.8, "pass_3": 63.2, "pass_4": 59.7 }, "airline": { "pass_1": 64.2, "pass_2": 58.9, "pass_3": 55.4, "pass_4": 52.1 }, "telecom": { "pass_1": 49.0, "pass_2": 43.7, "pass_3": 40.1, "pass_4": 37.2 } }, "methodology": { "evaluation_date": "2025-06-09", "tau2_bench_version": "0.1.3", "user_simulator": "gpt-4.1-2025-04-14", "notes": "Original evaluation from tau2-bench paper", "verification": { "modified_prompts": false, "omitted_questions": false, "details": "Verified evaluation with full trajectory data available." } }, "model_release": { "release_date": "2025-02-24", "announcement_url": "https://www.anthropic.com/news/claude-3-7-sonnet", "announcement_title": "Claude 3.7 Sonnet and Claude Code" } }