# 模型测试:章节与大纲 在「任务 → 模型测试」先选择测试任务,再选择生成模型和评审模型。 配置页会先显示项目就绪状态。已有正文必须具有有效的接纳基线和当前事实;缺失或过期时会说明原因并禁用开始按钮。测试不会代替作者建立基线或接纳正文。若运行途中失败,后台任务会保留具体错误说明。 ## 章节写作 - 「推荐下一章」保留 `next` 语义;下拉列表同时提供真实章纲的 ID、标题和正文状态,可选择其他已规划的待写章。 - 「输入章节 ID」适合直接定位长大纲中的条目。ID 必须对应可测试章纲;错误 ID 不会静默替换成下一章。 - 历史章或中间缺章若早于当前正文进度,暂时禁用并说明原因。当前全书事实不能作为历史章的章前状态;本次没有伪造历史事实快照。 - 保留真实框架和裸写诊断两种模式,以及单章目标字数。 ## 大纲设计 - 起点采用全书章号,包含起始章。例如从第 11 章开始设计 3 章,范围就是第 11–13 章。 - 默认接续现有大纲末尾;可以切换为指定起始章。一次设计 1–20 章,默认 3 章;起点必须晚于现有正文进度,结束章号最多 100000。 - 大纲使用真实规划器生成连续章纲,再验证结构与编号范围,保存独立候选并进行大纲专项评审。 - 大纲数量与章节目标字数相互独立。切换任务不会把字数误传为规划数量,也不会沿用裸写诊断模式。 - 结果分别保留请求范围和实际验证通过的产出范围;没有验证通过的章数显示未知,不根据目标数量补齐。 ## DAG 配置与执行证据 `GET /api/benchmarks/options` 是可选目标、任务能力、限制和 DAG 的权威来源。前端不自行拼接另一套执行依赖。 - 章节框架使用章节写作和完整章节评审流程;裸写诊断使用对应的简化写作路径。 - 大纲使用规划上下文、章纲生成、结构与范围验证、隔离产物保存和专项评审;评审排除正文文风、对白自然度等不适用检查,保留适用的结构、人物、情节、连贯、正典与安全检查。 - 可展开「智能 DAG 配置」查看节点和依赖。历史记录保存当次配置,之后切换任务不会改写旧配置。 - 「DAG 执行与证据」展示候选和各评审分支的实际节点状态、依赖、证据路径与摘要。未执行、失败、跳过和部分完成保持各自状态;流程结束不等于质量通过。 - 测试 DAG 保存在 benchmark 隔离运行中,不替换全局 DoG 或锁定的标准章节评审蓝图。 每个生成模型、重复轮次和评审模型组合使用隔离运行记录,正式大纲和正文不会被测试覆盖。失败候选不进入后续评审;前置依赖未完成时不能启动后继节点。 ## 工具调用 `novel_model_benchmark` 增加 `action: "options"`,可先读取可选章节和权威 DAG。 大纲提交示例: ```json { "action": "run", "task_type": "outline", "outline_start_chapter": 11, "outline_chapter_count": 3, "execution_mode": "framework", "writer_profile_ids": ["已配置的生成模型 ID"], "reviewer_profile_ids": ["已配置的评审模型 ID"], "repeats": 1, "concurrency": 1 } ``` 一个评审单元可能包含多个模型调用;界面的候选和评审数量不是底层 API 调用次数。实际模型用量与费用仍以服务端记录为准。