# 第 5 期 · 最终成绩(重赛,精确计时) > 由 `裁判/成绩汇总.py` 生成,数据来自 `赛事/结果/`、`赛事/盲评/`、`赛事/击穿结果/`、`赛事/终版复测/`。计分口径见 `赛事/重赛记录.md` 和 `说明.md`。 ## 一、三张榜 ### 团队总分 | 名次 | 队伍 | 主程 | 攻手 | 总分 | 主程速度 | 抗击穿 | 主程盲评 | 攻击 | 接手正确 | 接手速度 | 终版盲评 | |---|---|---|---|---|---|---|---|---|---|---|---| | 1 | 队F | MiMo V2.6 Pro | GPT-6 Astra | **90.8** | 99 | 59(被 2 人找到反例) | 70 | 100(6 个缺陷点) | 100(修复 2/2) | 94 | 78 | | 2 | 队C | Gemini 3.8 Flash | GPT-6.1 Sol | **77.9** | 99 | 0(被 5 人找到反例) | 48 | 79(4 个缺陷点) | 100(修复 7/7) | 98 | 52 | | 3 | 队A | Kimi K3 | Sonnet 5.5 | **71.4** | 96 | 96(被 0 人找到反例) | 57 | 22(2 个缺陷点) | 100(修复 0/0) | 71 | 60 | | 4 | 队D | DeepSeek V4.1 Flash | Opus 5.5 | **70.3** | 45 | 27(被 2 人找到反例) | 45 | 60(4 个缺陷点) | 100(修复 2/2) | 100 | 65 | | 5 | 队B | 豆包 Seed 2.1 Turbo | Fable 5.1 | **56.4** | 46 | 0(被 5 人找到反例) | 35 | 35(2 个缺陷点) | 100(修复 5/5) | 72 | 63 | | 6 | 队E | GLM 5.3 | Grok 4.7 | **20.4** | 39 | 8(被 4 人找到反例) | 48 | 33(2 个缺陷点) | 0(修复 0/4) | 0 | 48 | 权重:主程速度 15、抗击穿 10、主程盲评 5、攻击 20、接手正确 20、接手速度 20、终版盲评 10。 ### 主程榜(弱档) | 名次 | 主程 | 队伍 | 得分 | 速度 | 抗击穿 | 盲评 | |---|---|---|---|---|---|---| | 1 | Kimi K3 | 队A | **89.4** | 96 | 96 | 57 | | 2 | MiMo V2.6 Pro | 队F | **80.8** | 99 | 59 | 70 | | 3 | Gemini 3.8 Flash | 队C | **57.6** | 99 | 0 | 48 | | 4 | DeepSeek V4.1 Flash | 队D | **39.3** | 45 | 27 | 45 | | 5 | GLM 5.3 | 队E | **30.2** | 39 | 8 | 48 | | 6 | 豆包 Seed 2.1 Turbo | 队B | **28.7** | 46 | 0 | 35 | 得分 = (15 × 速度 + 10 × 抗击穿 + 5 × 盲评) / 30。 ### 攻手榜(强档) | 名次 | 攻手 | 队伍 | 得分 | 找反例 | 接手正确 | 接手速度 | 增值 | 终版盲评 | |---|---|---|---|---|---|---|---|---| | 1 | GPT-6 Astra | 队F | **86.2** | 100 | 100 | 94 | 53(平均 31.44 倍) | 78 | | 2 | Opus 5.5 | 队D | **84.8** | 60 | 100 | 100 | 100(平均 628.88 倍) | 65 | | 3 | GPT-6.1 Sol | 队C | **79.1** | 79 | 100 | 98 | 60(平均 48.43 倍) | 52 | | 4 | Fable 5.1 | 队B | **65.3** | 35 | 100 | 72 | 63(平均 54.23 倍) | 63 | | 5 | Sonnet 5.5 | 队A | **55.1** | 22 | 100 | 71 | 32(平均 8.07 倍) | 60 | | 6 | Grok 4.7 | 队E | **15.4** | 33 | 0 | 0 | 0(平均 — 倍) | 48 | 得分 = 0.25 找反例 + 0.20 接手正确 + 0.20 接手速度 + 0.20 增值 + 0.15 终版盲评。增值看同一批数据上终版比主程原版快多少倍(括号里是各组的几何平均)。 ## 二、第 3 轮终版在 9 组隐藏负载上的表现(精确计时) 每格:终版 CPU 秒 / 相对参考实现的加速比。参考实现是干净但没有优化的写法。 | 负载 | 参考实现 | Kimi K3 → Sonnet 5.5 | 豆包 Seed 2.1 Turbo → Fable 5.1 | Gemini 3.8 Flash → GPT-6.1 Sol | DeepSeek V4.1 Flash → Opus 5.5 | GLM 5.3 → Grok 4.7 | MiMo V2.6 Pro → GPT-6 Astra | |---|---:|---:|---:|---:|---:|---:|---:| | medium | 55.5 秒 | 0.231 秒 / 240 倍 | 0.193 秒 / 287 倍 | 0.045 秒 / 1221 倍 | 0.045 秒 / 1229 倍 | 出错 | 0.057 秒 / 971 倍 | | flood | 71.2 秒 | 0.241 秒 / 295 倍 | 0.102 秒 / 696 倍 | 0.027 秒 / 2686 倍 | 0.027 秒 / 2665 倍 | 出错 | 0.031 秒 / 2333 倍 | | lowbattery | 17.9 秒 | 0.135 秒 / 132 倍 | 0.159 秒 / 113 倍 | 0.026 秒 / 695 倍 | 0.027 秒 / 668 倍 | 出错 | 0.033 秒 / 541 倍 | | dynamic | 51.8 秒 | 0.590 秒 / 88 倍 | 0.645 秒 / 80 倍 | 0.084 秒 / 619 倍 | 0.064 秒 / 810 倍 | 出错 | 0.125 秒 / 415 倍 | | mixed | 58.1 秒 | 0.416 秒 / 140 倍 | 0.450 秒 / 129 倍 | 0.070 秒 / 829 倍 | 0.053 秒 / 1086 倍 | 出错 | 0.088 秒 / 663 倍 | | long | 62.0 秒 | 0.262 秒 / 237 倍 | 0.163 秒 / 379 倍 | 0.045 秒 / 1374 倍 | 0.043 秒 / 1435 倍 | 出错 | 0.052 秒 / 1191 倍 | | heavy_c | 155.4 秒 | 1.266 秒 / 123 倍 | 1.391 秒 / 112 倍 | 0.181 秒 / 859 倍 | 0.151 秒 / 1031 倍 | 出错 | 0.288 秒 / 540 倍 | | heavy_b | 327.5 秒 | 2.141 秒 / 153 倍 | 2.250 秒 / 146 倍 | 0.231 秒 / 1418 倍 | 0.231 秒 / 1418 倍 | 出错 | 0.321 秒 / 1019 倍 | | heavy_a | 218.9 秒 | 2.516 秒 / 87 倍 | 3.156 秒 / 69 倍 | 0.217 秒 / 1008 倍 | 0.171 秒 / 1283 倍 | 出错 | 0.339 秒 / 647 倍 | 重负载 `heavy_a/b/c` 是重赛时新增的 3 组;其余 6 组和第 1 轮的隐藏负载是同一张图、同一批事件,只多了两个新参数。 ## 三、相对原始屎山基线快了多少(6 组有基线成绩的负载,几何平均) 屎山基线不认识新格式,这里用同图旧格式上的基线用时(第 1 轮测的),所以是近似对比。新增的 3 组重负载没有测屎山基线。 | 队 | 第 1 轮主程原版 | 第 3 轮终版 | 接手后又快了(9 组,含重负载) | |---|---:|---:|---:| | Kimi K3 → Sonnet 5.5 | 81 倍 | 402 倍 | 8.1 倍 | | 豆包 Seed 2.1 Turbo → Fable 5.1 | 9 倍 | 489 倍 | 54.2 倍 | | Gemini 3.8 Flash → GPT-6.1 Sol | 95 倍 | 2505 倍 | 48.4 倍 | | DeepSeek V4.1 Flash → Opus 5.5 | 7 倍 | 2743 倍 | 628.9 倍 | | GLM 5.3 → Grok 4.7 | 7 倍 | 出错 | — | | MiMo V2.6 Pro → GPT-6 Astra | 99 倍 | 1988 倍 | 31.4 倍 | ## 四、"快到碰到计时精度下限":初测和精确重测的对比 Windows 进程 CPU 计时的最小刻度约 0.016 秒。初测每组只跑 1~3 遍取中位数,前三名在 6 组轻负载上只用了 2~3 个刻度(0.03~0.05 秒),好几组数字完全相同。 精确重测把每组连跑多遍直到累计 CPU 达到 2 秒再取平均,规则和公式不变。名次没有变化。 | 负载 | Sonnet 5.5 | Fable 5.1 | GPT-6.1 Sol | Opus 5.5 | GPT-6 Astra | |---|---:|---:|---:|---:|---:| | medium | 0.266 → 0.2309 秒(9 遍) | 0.219 → 0.1932 秒(11 遍) | 0.047 → 0.0455 秒(44 遍) | 0.047 → 0.0451 秒(45 遍) | 0.062 → 0.0571 秒(35 遍) | | flood | 0.266 → 0.2413 秒(9 遍) | 0.094 → 0.1023 秒(20 遍) | 0.031 → 0.0265 秒(76 遍) | 0.031 → 0.0267 秒(76 遍) | 0.031 → 0.0305 秒(66 遍) | | lowbattery | 0.156 → 0.1354 秒(15 遍) | 0.172 → 0.1586 秒(13 遍) | 0.031 → 0.0257 秒(79 遍) | 0.031 → 0.0267 秒(76 遍) | 0.031 → 0.0330 秒(61 遍) | | dynamic | 0.609 → 0.5899 秒(4 遍) | 0.703 → 0.6445 秒(4 遍) | 0.094 → 0.0837 秒(25 遍) | 0.078 → 0.0640 秒(32 遍) | 0.141 → 0.1250 秒(16 遍) | | mixed | 0.453 → 0.4156 秒(5 遍) | 0.500 → 0.4500 秒(5 遍) | 0.078 → 0.0700 秒(29 遍) | 0.062 → 0.0535 秒(38 遍) | 0.109 → 0.0876 秒(23 遍) | | long | 0.297 → 0.2617 秒(8 遍) | 0.172 → 0.1635 秒(13 遍) | 0.047 → 0.0451 秒(45 遍) | 0.047 → 0.0432 秒(47 遍) | 0.062 → 0.0521 秒(39 遍) | | heavy_c | 1.359 → 1.2656 秒(3 遍) | 1.562 → 1.3906 秒(3 遍) | 0.203 → 0.1810 秒(12 遍) | 0.156 → 0.1507 秒(14 遍) | 0.328 → 0.2879 秒(7 遍) | | heavy_b | 2.312 → 2.1406 秒(3 遍) | 2.453 → 2.2500 秒(3 遍) | 0.250 → 0.2309 秒(9 遍) | 0.250 → 0.2309 秒(9 遍) | 0.359 → 0.3214 秒(7 遍) | | heavy_a | 2.781 → 2.5156 秒(3 遍) | 3.406 → 3.1562 秒(3 遍) | 0.250 → 0.2172 秒(10 遍) | 0.203 → 0.1706 秒(12 遍) | 0.359 → 0.3386 秒(6 遍) | | 攻手 | 接手速度 初测 → 精确 | 增值 初测 → 精确 | 攻手榜 初测 → 精确 | 团队总分 初测 → 精确 | |---|---:|---:|---:|---:| | GPT-6 Astra | 94.5 → 94.2 | 54.9 → 53.5 | 86.5 → 86.2 | 90.9 → 90.8 | | Opus 5.5 | 100.0 → 99.9 | 100.0 → 100.0 | 84.8 → 84.8 | 70.3 → 70.3 | | GPT-6.1 Sol | 98.6 → 98.4 | 58.3 → 59.9 | 78.8 → 79.1 | 77.9 → 77.9 | | Fable 5.1 | 72.1 → 71.9 | 59.1 → 62.9 | 64.6 → 65.3 | 56.5 → 56.4 | | Sonnet 5.5 | 70.7 → 70.8 | 29.7 → 32.1 | 54.6 → 55.1 | 71.4 → 71.4 | | Grok 4.7 | 0.0 → 0.0 | 0.0 → 0.0 | 15.4 → 15.4 | 20.4 → 20.4 | ## 五、盲评(可维护性) 正式分 0~10:三位裁判在同一个对话里评 12 份匿名代码,评到本队代码的那一票不计(括号里的就是没计入的)。百分制是评完后追问的整体印象分,只展示、不计分(屎山基线 10、干净参考 75)。 | 代码 | 作者 | GPT-6 Astra | Opus 5.5 | DeepSeek V4.1 Flash | 正式分 | 百分制(Astra / Opus / DeepSeek) | 百分制平均 | |---|---|---:|---:|---:|---:|---|---:| | 队F 终版 | MiMo V2.6 Pro → GPT-6 Astra | (7.5) | 6.5 | 9.0 | **7.8** | 78 / 52 / 83 | 71 | | 队F 主程 | MiMo V2.6 Pro | (6.5) | 7.0 | 7.0 | **7.0** | 72 / 62 / 71 | 68 | | 队D 终版 | DeepSeek V4.1 Flash → Opus 5.5 | 6.5 | (6.0) | (8.0) | **6.5** | 62 / 50 / 73 | 62 | | 队B 终版 | 豆包 Seed 2.1 Turbo → Fable 5.1 | 6.5 | 5.5 | 7.0 | **6.3** | 61 / 40 / 74 | 58 | | 队A 终版 | Kimi K3 → Sonnet 5.5 | 6.0 | 5.0 | 7.0 | **6.0** | 50 / 37 / 68 | 52 | | 队A 主程 | Kimi K3 | 5.0 | 5.0 | 7.0 | **5.7** | 43 / 38 / 69 | 50 | | 队C 终版 | Gemini 3.8 Flash → GPT-6.1 Sol | 6.5 | 3.0 | 6.0 | **5.2** | 64 / 26 / 65 | 52 | | 队C 主程 | Gemini 3.8 Flash | 5.5 | 4.0 | 5.0 | **4.8** | 51 / 30 / 57 | 46 | | 队E 主程 | GLM 5.3 | 4.5 | 4.5 | 5.5 | **4.8** | 39 / 32 / 62 | 44 | | 队E 终版 | GLM 5.3 → Grok 4.7 | 4.5 | 4.5 | 5.5 | **4.8** | 39 / 32 / 62 | 44 | | 队D 主程 | DeepSeek V4.1 Flash | 4.5 | (4.0) | (5.5) | **4.5** | 45 / 33 / 63 | 47 | | 队B 主程 | 豆包 Seed 2.1 Turbo | 3.0 | 3.0 | 4.5 | **3.5** | 27 / 22 / 47 | 32 | 一句话点评见 `赛事/盲评/汇总.md`。 ## 六、第 2 轮找到的 7 个缺陷点 | 缺陷点 | 类型 | 找到的攻手 | 分值 | |---|---|---|---:| | 豆包-1(豆包 Seed 2.1 Turbo) | 输出不同 | Sonnet 5.5、GPT-6.1 Sol、Opus 5.5、Grok 4.7、GPT-6 Astra | 1.0 | | Gemini-1(Gemini 3.8 Flash) | 输出不同 | Sonnet 5.5、Fable 5.1、Opus 5.5、Grok 4.7、GPT-6 Astra | 1.0 | | Gemini-2(Gemini 3.8 Flash) | 输出不同 | GPT-6 Astra | 1.8 | | Gemini-3(Gemini 3.8 Flash) | 超时 | GPT-6 Astra | 1.8 | | DeepSeek-1(DeepSeek V4.1 Flash) | 超时 | GPT-6.1 Sol、GPT-6 Astra | 1.6 | | GLM-1(GLM 5.3) | 超时 | Fable 5.1、GPT-6.1 Sol、Opus 5.5、GPT-6 Astra | 1.2 | | MiMo-1(MiMo V2.6 Pro) | 超时 | GPT-6.1 Sol、Opus 5.5 | 1.6 | 详见 `赛事/击穿结果/缺陷点归类.md`。 ## 七、终版复测(赛后额外项目,不计入总分) Astra、Opus 各开一个对话,给别队的 5 份终版找反例,45 分钟,参考实现公开给他们。 | 裁判 | 终版 | 用例 | 判定 | 说明 | |---|---|---|---|---| | GPT-6 Astra | 队B(豆包 Seed 2.1 Turbo → Fable 5.1) | 01_blocked_pickup_cache_thrash.in | 成立 | 超时:3 次都超过 60 秒(第 1 次 97.3 秒,参考实现 5.9 秒) | | GPT-6 Astra | 队E(GLM 5.3 → Grok 4.7) | 01_new_format.in | 成立 | 退出码 3221225477 | | Opus 5.5 | 队E(GLM 5.3 → Grok 4.7) | case1_tiny.in | 成立 | 退出码 3221225477 | | Opus 5.5 | 队E(GLM 5.3 → Grok 4.7) | case2_small.in | 成立 | 退出码 3221225477 | 成立的缺陷点 2 个:Grok 的终版没有实现新需求(两位裁判都找到);Fable 的终版在"上千个被封的取货点超过 1024 槽距离场池 + 每 tick 封锁抖动"时性能退化到超时(只有 Astra 找到,Opus 试过同方向但没超过池容量)。 Sonnet、Sol、Opus、Astra 四份终版没有被找到反例。两位裁判的检查记录在 `赛事/终版复测/提交/<裁判>/cases/*/说明.txt`。 ## 八、终版体检(主办方,不计入总分) - 边界对拍:每份终版 1500 个随机小用例(新格式),和参考实现逐字节比较。Sonnet、Fable、Sol、Opus、Astra 五份都是 **0 个不一致**。 - 极端对拍:1500 个里跳过 196 个参考实现太慢的,五份都是 **0 个不一致**。 - 性能探针:第 2 轮成立的 9 个超时类反例换成新格式后各跑一次(限时 60 秒)。没有超时,也没有输出不同。有三处比参考实现慢: | 用例 | 参考实现 | Sonnet 5.5 | Fable 5.1 | GPT-6.1 Sol | Opus 5.5 | Grok 4.7 | GPT-6 Astra | |---|---:|---:|---:|---:|---:|---:|---:| | 原打C_F_03_cache_thrashing_timeout.in | 1.6 秒 | 0.38秒 | 0.38秒 | 0.36秒 | 0.16秒 | 异常退出 | 0.34秒 | | 原打D_C_01_eager_unreachable_timeout.in | 2.5 秒 | 0.03秒 | 0.39秒 | 0.01秒 | 0.07秒 | 异常退出 | 0.00秒 | | 原打D_F_01_eager_tail_timeout.in | 1.7 秒 | 0.02秒 | 0.30秒 | 0.04秒 | 0.09秒 | 异常退出 | 0.05秒 | | 原打E_B_e2_timeout_800x1500.in | 1.4 秒 | 0.01秒 | 0.01秒 | 0.00秒 | 0.01秒 | 异常退出 | 0.00秒 | | 原打E_C_01_eager_dispatch_timeout.in | 2.5 秒 | 0.01秒 | 0.01秒 | 0.00秒 | 0.01秒 | 异常退出 | 0.00秒 | | 原打E_D_case3_block_churn_heavy.in | 2.0 秒 | 0.02秒 | 0.01秒 | 0.00秒 | 0.03秒 | 异常退出 | 0.00秒 | | 原打E_F_01_eager_dispatch_timeout.in | 0.7 秒 | 0.01秒 | 0.01秒 | 0.00秒 | 0.01秒 | 异常退出 | 0.00秒 | | 原打F_C_01_eager_unreachable_timeout.in | 2.8 秒 | 0.03秒 | 4.02秒 | 0.01秒 | 0.08秒 | 异常退出 | 0.00秒 | | 原打F_D_case3_blocked_pickup_churn_heavy.in | 1.8 秒 | 0.02秒 | 2.96秒 | 0.05秒 | 4.97秒 | 异常退出 | 0.04秒 | 日志:`赛事/运行记录/赛后流水线.log`。Grok 的终版在新格式上全部异常退出,没有参加对拍。