--- name: autoresearch-task-authoring description: 从论文与代码仓设计可交付的 AutoResearch 工程题,确定 Starter、Baseline、Reference、评分器、Harbor 结构和证据契约。用于出题、改题或审题;不替代提交包最终 QA。 --- # AutoResearch 出题 先读任务平台最新规则、项目示例和目标论文,再读 [authoring-contract.md](references/authoring-contract.md) 与 [前移 QA](references/shift-left-qa.md)。不得从旧题或别的仓库复制未经验证的结构。 1. 建立题目合同:允许修改面、冻结面、输入输出、预算、质量门、主指标方向和 0/1 锚点。完成论文身份、许可、优化面和当前权威题库证据后运行 `scripts/authoring_gate.py selection evidence.json`。 2. Starter 必须朴素、可运行且不故意削弱;Baseline 必须来自正式实现并能解释。 3. Reference 只能证明题目有改进空间,不能把算法答案写进 instruction;正式 B/R 使用相同数据、seed、预算和评测器。 4. 评分器从候选代码重新运行并独立计算结果,不采信候选自报分数;成功结果用同文件系统 stage 后原子替换。 5. 将作者材料、参赛者 workspace 和优化证据分开。Docker COPY、WORKDIR、入口与选定的平台 profile 必须形成一条可执行路径。 6. 先做小规模成对实跑,再决定是否值得开展双轨迹长跑。完成 Baseline/Reference、效应/噪声和独立复算后过 `pilot` 门;完成双镜像、Hidden 隔离和目标 Harness trial 后过 `container` 门。没有动态证据时明确写“未验证运行”。 7. 双轨迹分别保存正式血缘与失败轮,完成机外快照和恢复演练后过 `long_run` 门。失败必须用新 trial 修复,不覆盖旧 receipt 或拼接不同轮次证据。 8. 交付前使用 `autoresearch-qa-skills-0.3.4` 做双路独立本地质检。冻结唯一完整提交包 ZIP 及 SHA256;两种不同 AI 分别新建无历史上下文的会话,每个会话只发该 ZIP。不同模型家族优先,同类 AI 的不同版本也可以。不附带散文件、旧报告、作者解释或另一 AI 的结论。两路首轮质检均须完整实测;任一路命中硬失败或分歧未闭环即 NOT READY。审查报告是 `release` 门的输入,不能由作者原会话内自报结论替代。 9. 开源或外发前对主包、QA/self-check、轨迹和证据附件分别做隐私与可移植性检查;生成报告不得保留作者 home、凭据值或私有文件链接。按 [出题合同](references/authoring-contract.md#release-证据-schema) 生成 `release-evidence.json`,再运行 `python3 scripts/authoring_gate.py release release-evidence.json`。门禁会读取并校验两份 QA 报告、共识、隐私报告和 manifest 的内容与 SHA256;任一引用缺失、摘要被篡改、模型或会话不独立、ZIP 不同源或有未解决分歧都必须失败。 输出至少包括题面、接口、Starter、Baseline、Reference、评分器、冻结清单、证据清单、构建说明和验收命令。