{ "model_name": "RAFT-30B-A3B", "model_organization": "Northeastern University HAI Lab", "submitting_organization": "Northeastern University HAI Lab", "submission_date": "2026-04-30", "submission_type": "custom", "modality": "text", "contact_info": { "email": "wang.ziyi19@northeastern.edu", "name": "Ziyi Wang", "github": "Ziyiii0-0" }, "results": { "retail": { "pass_1": 82.45614035087719, "pass_2": 72.95321637426902, "pass_3": 66.22807017543859, "pass_4": 61.40350877192983, "cost": 0.0 } }, "is_new": true, "trajectories_available": true, "trajectory_files": { "retail": "results.json" }, "references": [ { "title": "RAFT: Learning from Failures — Error-Driven Reinforcement Learning for Tool Use", "url": "https://raft.hailab.io/", "type": "blog_post" } ], "methodology": { "evaluation_date": "2026-04-30", "user_simulator": "claude-sonnet-4-5-20250929", "notes": "RAFT-30B-A3B is Qwen3-30B-A3B-Thinking-2507 fine-tuned on synthetic retail-domain data. Training data was collected on a fully synthetic retail database whose entities (users, products, orders) are disjoint from the tau-bench evaluation database.", "verification": { "modified_prompts": false, "omitted_questions": false } } }