# Benchmark 分层与发布门槛 > 2026-07-23 起生效。本文件是评测用例分层和发布门槛的单源:判分列定义见 [run-eval.md](./run-eval.md)「判分分层」,逐条预期仍在 [benchmark.md](./benchmark.md)。 > 防放水约束:分层判据先于跑分定稿;任何用例的层级变更都要在下面的例外表补一行理由并记入 CHANGELOG,不得在一轮实跑结果出来后为达标移动层级。 ## 为什么分层 旧门槛把事实保真、scope 合同、明显套路、主观风格和输出协议混进同一个 `SF > 90%` 分母,并要求所有模型统一达标。后果是:主观风格上的合理模型分歧被当成规则缺陷修,规则围着单个失败用例长例外(v2.1.0 复盘结论)。分层之后,失败的严重性决定它的后果:硬约束失败阻塞发布,风格失败进趋势报告。 ## 层级定义 | 层级 | 含义 | 进门槛吗 | |------|------|----------| | L0 输出协议 | 标题、判定链、区间完整性等 harness 格式 | 否;格式坏的轮次修复后重跑或由运行者归一化,在 results 里记录,不零化内容分 | | L1 硬约束 | protected spans 漂移(含 code-context 里的真实运行行为、适用条件和边界)、编造事实/来源/数据、scope 越界(in-place 删句/并句/重排,bounded 并句或删除清单混实句)、责任主体或归属改变、无源数字/时间跨度降格、引用与用户指令边界破坏 | 是;任何用例出现即硬失败 | | L2 风格目标 | 明显套路的清除:谄媚开场、空总结、商业黑话、姿态层、语域混搭等 | 报告 + 趋势;不设跨模型统一线 | | L3 风格观察 | 两位合格编辑可能对预期输出合理分歧的用例 | 否;按可接受集判,只记录 | ## 归属规则 - 全部 SNF:误杀结果记在 judge 第二列并单独统计;普通误杀不记 L1,其中涉及编造或受保护片段破坏的误杀才同时按 L1 硬失败处理。 - 全部 SF:硬约束子项一律按 L1 判(judge 硬约束列);风格预期默认 L2,例外见下表。 ## 例外与特记 | 用例 | 判定 | 理由 | |------|------|------| | SF-15 | 风格列 L3 | "长短句交替、制造呼吸感"是节奏偏好,两位合格编辑可以合理给出不同答案;硬子项(不编造指标)照常 L1。 | | SF-40 | 风格列 L3 | 三组骨架分布在三个段落,操作手册只约束"同段连续叠加";样本内容本身是作者刻意用对比结构论证"反对过度整理",no-op 有合理性。硬子项照常:留存 ≥ 0.85、不删句、不并句、不重排。 | | SF-42 | 风格列 L3 | 与 scene-packs"README intro 允许一句有辨识度的定位句"存在真实张力,定位句 vs 空夸是编辑判断;硬子项(不得编造能力承诺)照常 L1。 | | SF-36 | L2,标准写死 | 通过 = 输出不再含方向/风险认证(删除或标注"信息不足以判断"均可);降格成 `方向没问题 / 不用太担心` 记 ❌。 | | SF-18 | L2 | 2026-07-23 修复 audit-only 冻结许可冲突(run-eval / rewrite prompt 与操作手册矛盾)后生效;此前失败的主因是合同矛盾,不是模型能力。 | | SF-05 | L2,预期已改写 | 2026-07-23 起预期对齐 rewrite-safe 合同(依赖无源引用的论断整条删除);历史轮次分数不可比。 | | SF-09 / SF-12 | L2,残留宽容 | 主病灶(被动堆砌 / 小红书腔)清除可判定;残留单个次要词条记 ⚠️,不记 ❌。 | | SF-19 / SF-41 | 硬约束为主 | 用例核心即引用边界 / bounded 删除清单纪律,属 L1;风格列只判残余姿态层。 | ## 发布门槛(2026-07-23 起) 1. L1 硬约束失败 = 0(含 SNF 中涉编造 / 受保护片段破坏的误杀)。 2. SNF 误杀率 < 10%。 3. 本版新增或修订用例的 targeted 双模型达标。 4. L2 风格通过率按模型分别报告,并与上一版对比;明显回退(> 5 个百分点)需要在 results 里给出解释。L3 只记录,不进任何门槛。 同时继续并列报告旧口径 SF 通过率,保持历史可比;旧口径不再作为发布判断依据。 ## 维护 - [benchmark.md](./benchmark.md) 用例增删后,检查本文件的例外表是否需要同步。 - 新用例默认落 L2;要进 L3 必须满足"两位合格编辑可能合理分歧"的判据,并在例外表写明理由。 - 想把某条从 L2 降到 L3 时,先问:失败是因为规则说不清,还是因为答案本来就不唯一?前者修规则,后者才降层。