{ "schema": "chi-bench/submission/v1", "submission": { "id": "chi-bench-leaderboard-2026-05-15-openai-agents-moonshotai-kimi-k2-6", "team": "chi-Bench Leaderboard", "contact": "leaderboard@actava.ai", "agent": "openai-agents", "model": "moonshotai/kimi-k2.6", "notes": "Paper-baseline submission generated from the curated25 full-matrix experiment logs. Trials are the latest available run per (domain, task).\n", "submitted_at": "2026-05-04T07:47:06Z" }, "dataset": { "version": "chi-bench-v1.0.0", "domains": [ "pa_provider", "pa_um", "cm" ], "name": "chi-bench" }, "results": { "overall": { "n_trials": 225, "n_tasks": 75, "pass_at_1": 0.15111111111111108, "mean_cost_usd": 1.2181144675555555, "mean_walltime_s": 1422.9322827777778 }, "per_domain": { "pa_provider": { "n_trials": 75, "n_tasks": 25, "pass_at_1": 0.1733333333333333, "mean_cost_usd": 1.4488802114666666, "mean_walltime_s": 1210.6539233066667 }, "pa_um": { "n_trials": 75, "n_tasks": 25, "pass_at_1": 0.2533333333333333, "mean_cost_usd": 1.1204133075466667, "mean_walltime_s": 1351.8375677733334 }, "cm": { "n_trials": 75, "n_tasks": 25, "pass_at_1": 0.026666666666666665, "mean_cost_usd": 1.0850498836533333, "mean_walltime_s": 1706.3053572533333 } }, "mean_cost_usd": 1.2181144675555555, "mean_walltime_s": 1422.9322827777778 }, "provenance": { "chi_bench_git_sha": "a077ad96e11b813b20e0adf7065ebd52e524159d", "image_digest": null, "judge_model": "claude-opus-4-7", "harness_version": "0.1.0", "code_dirty": false, "dataset_version": "chi-bench-v1.0.0", "environment": "modal", "started_at": "2026-05-03T09:00:39Z", "finished_at": "2026-05-04T07:47:06Z", "host": "modal", "python_version": "3.12.3", "platform": "linux" } }